Vytvoriť Wiki

Vytvoriť Wiki

Referenčná séria o zostavovaní, vytváraní sietí, napájaní a prevádzke výpočtových systémov s umelou inteligenciou – pre kupujúcich a integrátorov, ktorí si vyberajú veľkosť svojho ďalšieho 4-GPU servera, 8-GPU servera alebo robotického laboratória.

Každý článok je napísaný na základe skutočných Kentino konštrukcií. Žiadne zbytočné zbytočnosti. S názorom tam, kde to inžinierstvo vyžaduje. Úprimný, čo sa týka limitov.

49články zverejnené 9tematické skladby 2nové za týždeň · Ut + Št

Základný server umelej inteligencie Séria W

Ak špecifikujete systém s viacerými grafickými kartami, prečítajte si najskôr tieto informácie. Pamäť, PCIe, napájanie, teploty, úložisko a užší výber grafických kariet.

W01RAM a VRAM: Ako sa vzťahujú na serveri s umelou inteligenciou4-GPU box so 192 GB VRAM a 32 GB RAM je nefunkčný. Správny pomer závisí od toho, čo v skutočnosti používate.
W02PCIe linky a topológia v multi-GPU AI serveriVýrok „PCIe x8 vs x16 nie je pre inferenciu dôležitý“ je väčšinou správny – a ľudia, ktorí ho opakujú, zvyčajne nevedia prečo.
W03Rozširujúce karty GPU: Kedy ich potrebujete a čo sa pokazíTam, kde integrita signálu potichu zomrie, sa linky potichu preškolia na Gen3 a skúšobné testovacie lavice, ktoré prejdú úspešne, začnú strácať jeden GPU denne.
W04Dimenzovanie zdroja PSU a konfigurácie s dvoma zdrojmi PSUMatematika, realita tvarového faktora a úprimné vysvetlenie napájania 4 a 8 GPU.
W05Teploty a prúdenie vzduchu v zostavách serverov s viacerými grafickými procesormi a umelou inteligenciouŠtyri grafické karty s výkonom 450 W každá predstavujú 1.8 kW tepla v jednej skrinke. Prúdenie vzduchu spredu dozadu, statický tlak a dôvod, prečo „má ventilátory“, nie je chladiaci plán.
W06Úrovne úložiska na serveri s umelou inteligenciouModel, dataset, scratch, checkpoint – štyri pracovné zaťaženia so štyrmi prístupovými vzormi. Jedna vrstva NVMe neslúži dobre žiadnej z nich.
W07Výber GPU: 5090, 4090, RTX Pro 6000, L40, L4Úprimné porovnanie so skutočnými číslami o výkonnosti, kompromismi a rozhodovacím postupom, ktorý skutočne používame pri hovoroch so zákazníkmi.

Tokenová ekonomika Séria T.

Matematika peňazí. Tokeny na euro, náklady na milión tokenov v on-premise verzus cloud a kedy ktorý model skutočne vyhráva.

T01Tokeny za sekundu za euroJediná metrika hodnoty GPU, ktorá je dôležitá pre inferenciu. Reálne tokeny/sekunda na euro v rámci 5090, 4090, RTX Pro 6000, L40, L4.
T02Cena za milión tokenov: On-Prem vs. cloudOn-premise verzus cloud, prepočítané v eurách. Kde je rozdiel a prečo vyhráva cloudový účet, až kým zrazu neprestane.
T03Ekonómia trvalej vs. prudkej inferencieNeustála nepretržitá inferencia a nepravidelné dávkové úlohy majú opačné ekonomické výhody. Kedy vyhráva lokálna platforma a kedy vás zachráni cloud.

Linux / OS / Softvér Séria L

Softvérový balík pod GPU. Pripnutie ovládačov, nastavenie CUDA, ladenie jadra, súborové systémy a monitorovanie.

L01Ubuntu Pinning a správa ovládačov NVIDIAPripnúť jadro, pripnúť ovládač alebo sledovať, ako aktualizácia apt vypne vaše grafické karty. Správa ovládačov, ktorá prežije reštartovanie.
L02CUDA, cuDNN a sada nástrojov NVIDIA Container ToolkitRozumná cesta nastavenia. Verzionovanie CUDA vs. ovládač vs. toolkit a kontajnerová trasa, ktorá zastaví peklo závislostí.
L03Ladenie jadra Linuxu pre servery s umelou inteligenciouČo v skutočnosti hýbe dynamikou v oblasti pracovných úloh s umelou inteligenciou – obrovské stránky, NUMA, afinita k IRQ – a čo je cargo-kult.
L04Výber súborového systému pre servery s umelou inteligenciouXFS, ZFS, ext4 – a prečo Btrfs nie je na zozname pre servery s umelou inteligenciou. Priraďte súborový systém k prístupovému vzoru.
L05Monitorovací zásobník: Prometheus, Grafana, DCGM, LokiPozrite si teploty GPU, VRAM, chyby ECC a zlyhania úloh skôr, ako vás budú stáť tréningový cyklus.

networking Séria N

Realita NVLink, topológie klastrov (list-chrbtica, fat-tree, vážka, bezspínačová), analýza latencie, smerovanie a nastavenie RDMA v praxi.

N03NVLink a NVSwitch: Keď na tom záležíMarketing DGX sa chváli terabajtmi za sekundu šírky pásma NVLink. Pre väčšinu úloh Kentino to nepotrebujete.
N04Prepínané topológie: Tučný strom, Listová chrbtica, Vážka, TesseractKaždý klastrový diagram začína rovnako. Skutočnou voľbou je, aká topológia, aký vysoký bude nadmerný počet predplatených portov a aká bude rýchlosť na port.
N05Bezprepínacie topológie: Mesh, Ring, Direct-Connect32-portový 400 GbE prepínač dosiahne v polovici roka 2026 cenu 40 000 až 80 000 eur. Pre 2 až 4 uzly ho nepotrebujete.
N06Disekcia latencie: Kam ide každá mikrosekundaĽudia dimenzujú siete pomocou grafov šírky pásma. Potom ich benchmark allreduce vypíše číslo, ktoré sa ani zďaleka nepribližuje rýchlosti linky.
N07Smerovanie: ECMP, adaptívne smerovanie, DCQCNČo sa deje nad káblami, sieťovými kartami a prepínačmi: ako pakety nachádzajú cestu a čo zabraňuje kolapsu štruktúry pri all-reduce.
N08Nastavenie RDMA v praxi + návrh klastrového uplinkuPraktické cvičenie: inštalácia ovládačov, overenie cesty, zapnutie GPUDirect, overenie NCCL a následný krok a návrh uplinku pre celý klaster.

zhlukovaniu Séria K

Keď jeden uzol nestačí. Rozhodovanie o jednom verzus viacerých uzloch, distribuované trénovanie, inferenčné klastre, zdieľané úložisko, plánovanie a spracovanie zlyhaní.

K01Jednouzlový multi-GPU verzus viacuzlový: Kedy je potrebné škálovaťNajdrahšou chybou je rozdelenie rozpočtu GPU medzi dva uzly, keď by prácu vykonal jeden väčší uzol.
K02Distribuované školenia v roku 2026: DDP, FSDP2, DeepSpeed, MegatronŠtyri open-source stacky, päť osí paralelizmu a ktorú z nich si vlastne vybrať pre ktorú úlohu.
K03Inferenčné klastre: vLLM Tensor Parallel, Pipeline ParallelModel 70B sa nezmestí na jednu GPU s užitočnou vyrovnávacou pamäťou KV. Model 405B sa nezmestí na jeden uzol. Spôsob, akým model rozrežete, určuje, koľko bude stáť.
K04Klastrové úložisko: NFS, BeeGFS, Lustre, objektové úložiskáZdieľané úložisko je súčasťou distribuovaného klastra, na ktorú nikto nemyslí, kým grafické procesory nedosiahnu 40 % využitie.
K05Plánovanie úloh: SLURM, Kubernetes, RaySLURM, Kubernetes, Ray – a vedieť, kedy nič z toho nepotrebujete. Prispôsobte plánovač veľkosti tímu.
K06Riešenie zlyhaní v klastroch umelej inteligencieČo sa v klastri GPU skutočne pokazí a ako to obnoviť – kontrolné body, kontroly stavu a vyprázdňovanie chybných uzlov.

Integrácia Séria I.

Spojenie všetkých procesov – nastavenie inferenčného servera, laboratórna sieť a rozpočty napájania, zostavenie referencie a nasadenie flotily.

I01Architektúra okrajovej umelej inteligencie: Robot ↔ Lokálny inferenčný serverČlánok zlatého štandardu. Humanoid, ktorého ste si kúpili, je len polovica systému; toto je druhá polovica a to, ako sú tieto dve polovice prepojené.
I02Nastavenie inferenčného servera: vLLM, llama.cpp, SGLangInštalácia, poskytovanie a porovnávanie. Ktorý engine pre ktorý model a cieľová latencia.
I03Topológia siete pre výpočtové laboratórium robotiky a umelej inteligencieZapojenie laboratória robotiky a umelej inteligencie – prepojenia robotov, uplinky inferenčných serverov a kde sa skrýva latencia.
I04Rozpočet na napájanie a chladenie pre laboratórium robotiky a umelej inteligencieDimenzovanie napájania a chladenia pre zmiešané laboratórium robotiky a umelej inteligencie pred podpísaním nájomnej zmluvy.
I05Referenčná zostava: Laboratórium robotiky a umelej inteligencie v jednom rackuKompletné laboratórium robotiky a umelej inteligencie v jednom racku – kusovník, rozloženie a kompromisy, ktoré by sme skutočne dodali.
I06Nasadenie flotily: Viacero robotov, zdieľané výpočtyViacero robotov, zdieľané výpočty. Ako nastaviť veľkosť a naplánovať inferenciu pre flotilu, nie pre demo.

Dodávka energie Séria P

Dodávanie čistého napájania do racku. Fázy, PDU, vyvažovanie, ističe, UPS a generátory pre výpočty s umelou inteligenciou.

P01Jednofázový vs. trojfázový výkonKeď 4-GPU box prerastie jeden 16 A obvod a akú trojfázovú elektródu vlastne získate v AI racku.
P02Typy PDU: Základné, Merané, Prepínané, ATSČo každý z nich robí a čo skutočne potrebujete pre GPU rack.
P03Fázové vyváženie medzi AI rackmiRovnomerne zaťažte tri fázy alebo vypnite istič v najnevhodnejšom čase. Ako funguje vyvažovanie medzi stojanmi s umelou inteligenciou.
P04Dimenzovanie ističa a zapínací prúdTrvalé zaťaženie, nárazový prúd a pravidlo 80 %. Nadimenzujte ističe pre servery s grafickými procesormi, ktoré nespôsobujú rušivé vypnutie.
P05Dimenzovanie UPS pre AI ComputingTopológia, chemické zloženie batérie, doba prevádzky a rozdiel medzi kVA a kW, ktorý poddimenzuje polovicu UPS zakúpených v laboratóriách s umelou inteligenciou.
P06Generátor a prepínačKeď výdrž batérie nestačí. Základy dimenzovania generátora a prepínania pre laboratóriá umelej inteligencie.

Robotika Séria R · blog

Moderný humanoid je tvorený šiestimi alebo siedmimi inžinierskymi disciplínami spojenými dohromady. Anatómia, senzory, umiestňovanie výpočtov, SDK, siete, nákup a najmodernejší model sveta VLM.

R01Anatómia moderného humanoidaŠesť alebo sedem inžinierskych disciplín spojených dohromady. Čo sa vlastne nachádza vo vnútri moderného humanoida.
R02Anatómia štvornohého robotaŠtvornožci vymieňajú dosah za stabilitu a výdrž batérie. Mechanická a výpočtová anatómia tvarového faktora pracanta.
R03Zásobník senzorov robotaKamery, hĺbka, LiDAR, IMU, sila-krutiaci moment – ​​čo každý senzor ponúka a koľko stojí vo výpočtovom procese.
R04Výpočty na zariadení vs. mimo zariadenia pre robotyČo beží na robotovi a čo na serveri. Výmena latencie verzus kapacity, ktorú musí každé nasadenie urobiť.
R05SDK pre roboty, ROS 2 a simuláciaROS 2, SDK od dodávateľa a simulačné prostredia – softvér, s ktorým vyvíjate predtým, ako dorazí hardvér.
R06Robotické siete: Wi-Fi, Tethers, 5GWi-Fi, tethering, 5G – a prečo latencia, nie šírka pásma, rozhoduje o tom, čo môžete z robota vyťažiť.
R07Kúpa robota: Dodacie lehoty, colné vybavovanie, podporaNákup robotického hardvéru v EÚ nie je ako kúpa pracovnej stanice. Ako v skutočnosti vyzerajú dodacie lehoty, colné odbavenie a popredajná podpora.
R08Prečo roboty potrebujú špecializované Edge ComputeArgument latencie. Prečo umiestnenie vášho modelu za cloudové API narúša prípad použitia, ktorý zákazník skutočne chce.
R09Automatické označovanie pomocou svetových modelov riadených VLMNajmodernejší systém vnímania – Qwen2.5-VL, Grounded-SAM 2, Florence-2, NVIDIA Cosmos – aplikovaný na skutočné poznatky z robotiky.

Prípadové štúdie Séria C · blog

Skutočné Kentino stavia s reálnymi meraniami. Fotografie, kusovníky, porovnávacie kritériá a poctivé pitvy.

C01Prípadová štúdia: 4× pracovná stanica s umelou inteligenciou RTX 4090EPYC 7542, 512 GB DDR4 ECC, 4× RTX 4090. Nameraných 651.6 TFLOPS. 179.3 tok/s trvalo na vLLM. Vrchol 73 °C. Reálne čísla z dodanej zostavy.

Nové články každý utorok a štvrtok

Táto wiki je rastúca knižnica – nové články o zostavovaní, sieťovaní, klastrovaní, energii a robotike budú publikované do roku 2026, pričom každý z nich bude čerpaný zo skutočnej zostavy Kentina. Ak chcete, aby bola konkrétna téma uprednostnená, napíšte na info@kentino.com.