Kentino AI 576 Genoa RTXPro6000MQ 12000TOPS — 6× RTX Pro 6000 Blackwell Max-Q AI Frontier Server
Kentino AI 576 Genoa RTXPro6000MQ 12000TOPS — 6× RTX Pro 6000 Blackwell Max-Q AI Frontier Server
Kentino AI 576 Genoa RTXPro6000MQ 12000TOPS — 6× RTX Pro 6000 Blackwell Max-Q AI Frontier Server
Kentino AI 576 Genoa RTXPro6000MQ 12000TOPS — 6× RTX Pro 6000 Blackwell Max-Q AI Frontier Server
Kentino AI 576 Genoa RTXPro6000MQ 12000TOPS — 6× RTX Pro 6000 Blackwell Max-Q AI Frontier Server
Kentino AI 576 Genoa RTXPro6000MQ 12000TOPS — 6× RTX Pro 6000 Blackwell Max-Q AI Frontier Server
Kentino AI 576 Genoa RTXPro6000MQ 12000TOPS — 6× RTX Pro 6000 Blackwell Max-Q AI Frontier Server
Kentino AI 576 Genoa RTXPro6000MQ 12000TOPS — 6× RTX Pro 6000 Blackwell Max-Q AI Frontier Server
Kentino · Vlastný server s umelou inteligenciou

Kentino AI 576 Genoa RTXPro6000MQ 12000TOPS — 6× RTX Pro 6000 Blackwell Max-Q AI Frontier Server

Platforma podnikovej triedy, zostavená a testovaná v EÚ.

€110.023,00 bez DPH · poštovné sa vypočíta pri platbe
Vyrobené na objednávku – kontaktujte nás ohľadom dodacej lehoty
ISO 9001 · overený hardvérSklad a záruka v EÚ7+ rokov skúseností v oblasti podnikovej umelej inteligenciePred odoslaním testované zapálením
Prehľad
Často kladené otázky
Doprava a záruka

Kentino AI 576 Genoa RTXPro6000MQ 12000TOPS

576 GB ECC VRAM Frontier Server
6x RTX Pro 6000 Max-Q Turbofan | EPYC Genoa | 12 000 TOPS INT8

12 000
TOPS INT8
576 GB
fond ECC VRAM
Gen5
Prepínač Broadcom
Tichý
chladenie turbodúchadla

Publikované externé referencie. Nemerané na hardvéri Kentino.

7U racková inferenčná platforma pre špičkové systémy so šiestimi grafickými kartami NVIDIA RTX Pro 6000 Blackwell Max-Q s turbofan procesorom, 576 GB ECC VRAM, jedným procesorom AMD EPYC 9354 Genoa (32C/64T), 768 GB DDR5-4800 ECC (všetkých 12 kanálov obsadených), 4 TB NVMe bootovaním a 5x 1200 W serverovým zdrojom. Rovnaký kremík a pamäťový fond ako v pasívnej verzii Server Edition – iný chladič. Turbofan Max-Q je samostatný pre každú kartu, beží tichšie a toleruje menej prísne prúdenie vzduchu v šasi. Identický modelový obal ako u pasívneho súrodenca.

technické vybavenie

Zložka detail
GPU 6x NVIDIA RTX Pro 6000 Blackwell Max-Q 96 GB ECC (turboventilátor, špecifikácia TDP 600 W, PCIe 5.0 x16, 2000 INT8 TOPS na kartu)
fond VRAM Celkom 576 GB na 6 kartách (bez NVLink — P2P cez PCIe Gen5 s rýchlosťou ~55-60 GB/s na smer)
CPU AMD EPYC 9354 Genoa (32C/64T, 280 W, 128x PCIe 5.0 liniek, 12-kanálová DDR5)
Základná doska ASRock Rack GENOAD8X-2T/BCM (SP5 Genoa, integrovaný prepínač Broadcom PEX PCIe Gen5, 12x DDR5, 2x 10 GbE, IPMI)
Systémová RAM 768 GB DDR5-4800 ECC RDIMM (12x 64 GB — všetky kanály obsadené, celkovo ~460 GB/s)
Bootovanie / úložisko 4 TB NVMe M.2 (PCIe 4.0 x4) – dimenzované pre hraničné kontrolné stanovište
Zdroj 5x 1200 W serverový zdroj (kompatibilný s HP, spolu 6 kW)
Podvozok 7U rackový systém s 8 GPU, kapacita 10 slotov PCIe, aktívne rozširujúce karty Gen5
Chladenie Vežový chladič SP5 Genoa + 8x 120 mm ventilátory v šasi. Turboventilátory pre každú grafickú kartu sú samostatné – prúdenie vzduchu pre dátové centrá sa odporúča, ale nie je to nevyhnutne potrebné. Tichší pre laboratórne prostredia.
sieť Duálny 10 GbE integrovaný (Intel X550)

Napájacia obálka

  • Spotreba GPU (špecifikácia): 6 x 600 W = 3 600 W
  • Celkový výkon systému pri plnom zaťažení: ~4 080 W
  • Celkový výkon zdroja: 6 000 W (5x 1 200 W) — 32 % priestoru pre výšku
  • Karty Max-Q zvyčajne dosahujú trvalý výkon 520 – 550 W – reálny výkon nad 20 %

Chladenie (Max-Q diferenciátor)

Každá karta nasáva vzduch spredu dozadu pomocou vlastného ventilátora – samostatný ventilátor pre každú kartu. Zvládne zmiešané nasadenie v racku/otvorenej skrini. Tichšia ako ekvivalentný axiálny ventilátor. Profil firmvéru Max-Q uprednostňuje nižší trvalý výkon (typicky 520 – 550 W). Odporúčané: skriňa s perforovanými prednými dverami a priehľadnou zadnou výfukovou cestou.

Čo môžete spustiť

Identický so súrodencom Server Edition – rovnaký kremík, rovnaký 576 GB pool. DeepSeek V3 Q4 (~404 GB) s dlhým kontextom, Kimi-K2 Q2, Mistral Large 3 Q2-Q3, GLM-5 Q2, Qwen3-Coder-480B Q4.

LLM – text / uvažovanie / kódovanie

Čínska hranica

  • DeepSeek V3 / R1 / V3.1 / V3.2 v Q4_K_M (~404 GB) vyhovuje dlhému kontextu (~5-8 tok/s jeden vLLM TP-6, publikovaná referencia); FP8 natívny (~670 GB) s únikom RAM
  • Kimi-K2 (Základ / Inštrukt / Myslenie) pri Q2_K (~375 GB) pohodlne (~5-8 tok/s jeden, publikovaná referencia)
  • GLM-5 / GLM-5.1 (~745B/44B) pri Q2_K (~260 GB); Q3 (~420 GB) s preplnenou RAM
  • Qwen3-Coder-480B-A35B v Q4_K_M (~270 GB) s dlhým kontextom
  • Qwen3-235B-A22B pri bf16 (~470 GB) alebo FP8 (~240 GB)
  • ERNIE-4.5-424B-A47B v 4. štvrťroku (~240 GB) so 128 000 ctx
  • Intern-S1-Pro v Q2_K (~325 GB); Hunyuan-Veľký v 4. štvrťroku (~220 GB)
  • MiniMax-Text-01 / M1 v 4. štvrťroku (~260 GB)

Západná hranica

  • Mistral Large 3 v 2. – 3. štvrťroku (~243 – 317 GB) pohodlné (~20 – 30 tok/s jednotlivo, publikovaná referencia)
  • Flame 4 Maverick v Q4_K_M (~232 GB) s dlhým ctx (~45-55 tok/s jeden, publikovaná referencia)
  • Llama-3.1-Nemotron Ultra 253B pri 8. frameworku (~253 GB)
  • Grok-1 314B v 4. štvrťroku (~182 GB); Snehová vločka Arktída v 4. štvrťroku (~278 GB)
  • Pokyny DBRX 132B/36B pri bf16 (~264 GB) alebo fp8

Modely vizuálno-jazykového vnímania

Qwen3-VL-235B-A22B; InternVL3.5-241B-A28B Q4; GLM-4.5V / 4.6V 106B bf16; Llama 3.2 90B Vision bf16; Pixtral Large 124B fp8; Molmo 72B bf16.

Generovanie obrazu

Inštrukcia HunyuanImage-3.0; FLUX.1 [dev] / [shnell] / Kontext multi-instance (~15-20 s na obrázok 1024x1024, publikovaná referencia); SD 3.5 Large; SDXL; AuraFlow; OmniGen; HunyuanImage-2.1; Kolors 2.0.

Generovanie videa

Wan 2.2 T2V-A14B duálny expert MoE bf16; HunyuanVideo 13B bf16; Open-Sora 2.0 (11B); Mochi-1 (10B); NVIDIA Cosmos Predict 2 až do 14B; CogVideoX-5B; LTX-Video; Pyramid Flow.

Zvuk / Reč / TTS

Full stack rezident: Whisper v3 large, Parakeet-TDT 1.1B, Canary 1B, Moshi 7B realtime, Qwen3-Omni, Step-Audio R1, CosyVoice 3.0, Kokoro, Stable Audio Open.

Poskytovanie viacerých modelov / viacerých nájomníkov

  • DeepSeek V3 Q4 + FLUX + HunyuanVideo + Whisper/Moshi v reálnom čase, všetci rezidenti
  • Súbežný 70B tenzorovo paralelný + 235B-MoE na samostatných PCIe doménach
  • 3 hraničné modely rezidentné pre A/B hodnotenie

Cieľové pracovné zaťaženia

  • Výskumné laboratórium Frontier s otvorenou hmotnosťou a zmiešaným/neideálnym prúdením vzduchu v infračervenej technológii
  • Kolokácia / súkromné ​​dátové centrum, kde je turboventilátor na kartu prevádzkovo jednoduchší ako plne pasívne prúdenie vzduchu
  • Nasadenie suverénnej umelej inteligencie s modelovým stackom Apache 2.0 / MIT
  • Podniková multimodelová platforma RAG + agenti
  • Laboratórne prostredia s otvorenými regálmi

Publikované referencie výkonnosti

Externé referencie | Rovnaký kremík ako v Server Edition | Nemerané na hardvéri Kentino

mierka Výsledok
RTX Pro 6000 na kartu INT8 TOPS 2 000 TOPOV
vLLM – DeepSeek V3 Q4 na 6x RTX Pro 6000 (single) ~25-40 tok/s
vLLM – DeepSeek V3 Q4 na 6x RTX Pro 6000 (šarža-32) Agregát s výkonom 200 – 400 tok/s
FLUX.1 [dev] fp8 na jednej grafickej karte RTX Pro 6000 ~15-20 s na obrázok s rozlíšením 1024x1024

Presné čísla potvrdené vo fáze PoC. Kentino zverejní čísla od prvej strany po prvotnej zákazníckej verzii.

Nie ideálne pre

  • Kimi-K2 / DeepSeek V3 v 4. štvrťroku poskytuje produkčné služby s reálnou rýchlosťou – prejdite na Kentino AI 768 TurinDual RTXPro6000MQ
  • Školenie od nuly na modeloch hraničnej triedy – bez NVLink
  • Nasadenie typu „plug-and-play“ – hraničné služby ministerstva životného prostredia potrebujú skúsený tím MLOps

Záruka a dodacia lehota

2 rokov
záruka na diely
1 rok
záruka na prácu
10-28 dni
Čas prípravy

Zostavenie zahŕňa montáž, konfiguráciu BIOSu, inštaláciu ovládačov, nastavenie, memtest, overenie funkčnosti a nastavenie prostredia LLM. Dodacia lehota závisí od dostupnosti komponentov, ktorá sa potvrdí pri objednávke.

Odporúčané doplnky

  • Sieťová karta NVIDIA ConnectX-5 MCX555A-ECAT 100 GbE pre škálovanie viacerých uzlov
  • Druhý 4 TB NVMe disk pre knižnicu dát/modelov
  • Plná 24U racková skriňa s perforovanými prednými dverami
  • Online UPS 10 kVA
  • Spravovaná PDU

Otázky, ktoré nám kupujúci kladú najčastejšie pred objednaním servera.

Ako dlho to trvá?

Stroje vyrobené z komponentov, ktoré máme pripravené, expedujeme rýchlo; čokoľvek, čo vyžaduje konkrétnu generáciu GPU, závisí od dodávok. Pred zaplatením vám oznámime dátum a ak sa dodávka zmení, oznámime vám to, namiesto toho, aby ste sa o tom dozvedeli.

Dá sa konfigurácia zmeniť pred zostavením?

Takmer vždy. Grafické karty, pamäť, úložisko a chladenie sa vyberajú pre každú objednávku a uvedená konfigurácia je skôr východiskovým bodom ako fixným balíkom. Ak potrebujete viac VRAM, rýchlejšie úložisko alebo iný prístup k chladeniu, oznámte to pred objednaním a my vám poskytneme cenovú ponuku.

Môžem si server vyzdvihnúť osobne?

Môžete. Náš sklad sa nachádza v Prahe a osobný odber je vítaný – väčšina ľudí, ktorí prídu, využije návštevu na to, aby si s naším technikom prezreli stroj a položili otázky, ktoré sú cez e-mail nepríjemné. V prípade objednávok v rámci Českej republiky sa tiež snažíme doručiť osobne a sprevádzať vás nastavením na mieste.

Môžem sa porozprávať s niekým, kto skutočne rozumie pracovnej záťaži?

Áno. Máme inžiniera, ktorý pracuje konkrétne na systémoch umelej inteligencie, nie na všeobecnom predajnom oddelení. Ak sa vaša otázka týka veľkosti dávok, kvantizácie, prepojení alebo toho, kde bude vaše úzke miesto, opýtajte sa – takýto rozhovor zvyčajne zmení konfiguráciu k lepšiemu.

Ktorý model môžem spustiť na tejto konfigurácii?

Áno. Každý stroj je pred odoslaním zostavený, otestovaný v praxi a porovnaný s reálnymi záťažami umelej inteligencie. Po odoslaní máme nainštalovaný a spustený LLM. Zapojíte ho, pripojíte k sieti a začnete pracovať – zostáva už len rozhodnutie, ktorý projekt spustíte ako prvý.

Ako otestujete server pred odoslaním?

Porovnávame ho so skutočnými záťažami umelej inteligencie, a nie so syntetickými skóre: inferenčná priepustnosť, trvalé správanie pri záťaži a teploty pri nepretržitej prevádzke. Výsledky benchmarkov získate so strojom, takže výkon, ktorý vám bol sľúbený, je výkon, ktorý si môžete overiť hneď v prvý deň.

Je server pripravený na spustenie, keď dorazí?

Áno. Každý stroj je pred odoslaním zostavený, otestovaný v praxi a porovnaný s reálnymi záťažami umelej inteligencie. Po odoslaní máme nainštalovaný a spustený LLM. Zapojíte ho, pripojíte k sieti a začnete pracovať – zostáva už len rozhodnutie, ktorý projekt spustíte ako prvý.

Odosielame z nášho skladu v EÚ. Ťažké položky môžu vyžadovať prepravu – kontaktujte nás pre cenovú ponuku na prepravu a dodaciu lehotu. 2-ročná obmedzená záruka s rozšírenou podporou RMA; k dispozícii je predĺžená záruka.

Nie je to presne to, čo potrebujete?

Povedzte nám o vašej pracovnej záťaži a my túto platformu prispôsobíme jej špecifikáciám – grafické karty, pamäť, úložisko a chladenie zodpovedajú tomu, čo skutočne používate.