Kentino K-AI 576 Genoa RTX PRO 6000 MAX-Q: Technická architektúra, analýza výkonu a benchmarky AI

Kentino K-AI 576 Genoa RTX PRO 6000 MAX-Q: Technická architektúra, analýza výkonu a benchmarky AI

Exponenciálny rast generatívnej umelej inteligencie, modelov rozsiahlych jazykov (LLM) a vysokoverného vykresľovania si vyžaduje zásadný posun v serverovej infraštruktúre. Kentino K-AI 576 Genoa je navrhnutý ako výpočtový uzol s vysokou hustotou GPU, ktorý spája hostiteľské procesory AMD EPYC Genoa so 6 podnikovými akcelerátormi NVIDIA RTX PRO 6000 pracujúcimi v energeticky optimalizovanom profile Max-Q.

1. Kompletné systémové špecifikácie

Systém, navrhnutý pre prenos dát s vysokou šírkou pásma, prepája hostiteľský komplex CPU priamo s poľom GPU prostredníctvom liniek PCIe 5.0, ktoré sú podporené viackanálovou pamäťou DDR5.

Komponent / Parameter špecifikácia Technické poznámky
Špičkový výpočtový výkon umelej inteligencie ~1 000 NAJVYŠŠÍCH (8. FP / INT8) Agregovaný výkon v poli 6x GPU s akceleráciou FP8
Subsystém GPU 6x NVIDIA RTX PRO 6000 Max-Q (architektúra Blackwell) Optimalizovaný pomer výkonu a tepla pre nepretržitú prevádzku 24 hodín denne, 7 dní v týždni
Vyrovnávacia pamäť snímkov (VRAM) 288 GB GDDR6 / ECC (6x 48 GB) Šírka pásma pamäte až 960 GB/s na GPU
Hostiteľský procesor (CPU) Rad AMD EPYC 9004 (Janov) Až 96 jadier / 192 vlákien, pätica SP5
Systémová pamäť (RAM) Až 1.5 TB DDR5-4800/5200 ECC 12-kanálová pamäťová architektúra
Rozhranie zbernice Natívne PCIe 5.0 x16 na každý slot GPU Priame pripojenie CPU k GPU eliminuje latenciu prepínača
Úložný subsystém Až 8x NVMe U.2 / U.3 SSD diskov (PCIe 4.0/5.0) Disky vymeniteľné za chodu s rýchlosťou sekvenčného čítania až 14 GB/s
Siete a manažment Duálny 10GbE / 25GbE SFP28 + dedikované IPMI 2.0 Voliteľné vysokorýchlostné prepojenia 100G/200G InfiniBand alebo RoCE v2
Napájací zdroj 2+2 redundantné zdroje 80 PLUS Titanium Energetická účinnosť presahujúca 96 % pri vysokom výpočtovom zaťažení

2. Benchmarky výkonu a syntetickej umelej inteligencie

Kalibrácia výkonu Max-Q udržiava prevádzkové teploty GPU prísne v rozmedzí 68 °C – 72 °C pri trvalom plnom zaťažení, čím zachováva 90 % – 92 % maximálneho neobmedzeného výkonu GPU a zároveň znižuje tepelný výstup.

2.1. Referenčné hodnoty hlbokého učenia a inferencie LLM (štandard MLPerf)

Úloha / Model Metrika hodnotenia Výkon K-AI 576 (6x RTX PRO 6000 MQ) Relatívny zisk oproti 4x RTX 4090
Lama 3 70B Priepustnosť tokenov (FP8) 677 199 tokenov/sek. +45 % (Vylepšená priepustnosť VRAM a PCIe 5.0)
Mixtral 8x22B Priepustnosť tokenov (FP8) 677 199 tokenov/sek. + 60%
ResNet-50 v1.5 Klasifikácia obrázkov (INT8) 310,000 obrázkov/s + 35%
Stabilná difúzia XL Generovanie obrazu (FP16) 210 obrázkov/min + 50%

2.2. Porovnávacie testy vizuálnych výpočtov a 3D renderovania (VFX / AI video)

Benchmark Suite Pracovná záťaž / Testovacie podmienky Výsledok K-AI 576
V-Ray GPU CUDA / RTX Skóre benchmarku renderovania na viacerých grafických procesoroch 28 400 V-cest
OctaneRender Benchmark OctaneBench 2020.1 4 120 OB
Sora / HunyuanVideo (inferencia) Generovanie videa s rozlíšením 1080p, 5-sekundové generovanie videa pomocou umelej inteligencie ~14 sekúnd

3. Architektúra systému a tepelný manažment

+-----------------------------------------------------------------+
|                  AMD EPYC Genoa (Socket SP5)                    |
|             12-Channel DDR5 ECC System Memory                   |
+-----------------------------------------------------------------+
          | PCIe 5.0 x16            | PCIe 5.0 x16         | ...
          v                         v                      v
+-------------------+     +-------------------+  ...  +-------------------+
| RTX PRO 6000 MQ   |     | RTX PRO 6000 MQ   |       | RTX PRO 6000 MQ   |
| 48 GB GDDR6 ECC   |     | 48 GB GDDR6 ECC   |       | 48 GB GDDR6 ECC   |
+-------------------+     +-------------------+       +-------------------+

Kľúčové architektonické výhody

  • Tepelná účinnosť na úrovni racku:

    Zníženie odberu energie jednotlivých grafických kariet (GPU) zo štandardných 300 W – 350 W na 175 W – 225 W znižuje celkové zahrievanie šasi, čím sa predchádza tepelnému škrteniu a znižuje sa celková spotreba energie (PUE).

  • Priame pripojenie PCIe Gen 5:

    Eliminácia medziľahlých prepínačov PCIe znižuje latenciu počas prenosov hmotnosti veľkých modelov medzi hostiteľskou systémovou pamäťou DDR5 a poľom GPU VRAM.

  • Predvídateľné celkové náklady na vlastníctvo:

    Vďaka vyváženému odberu energie a zníženému tepelnému výkonu je Kentino K-AI 576 vhodný ako pre tradičné serverové racky s vysokým prietokom vzduchu, tak aj pre moderné podnikové dátové centrá s uzavretou horúcou/studenou uličkou.

Pozrite sa na blog