InfiniBand vs RoCE vs Plain Ethernet: Výber Fabric v roku 2026

V každej žiadosti o cenovú ponuku pre viacuzlový klaster s umelou inteligenciou sa zobrazujú tri možnosti prenosu: InfiniBand, RoCE a obyčajný TCP/IP Ethernet. Nie sú to tri body na tej istej čiare. Sú to tri rôzne inžinierske filozofie – bezstratová HPC štruktúra už od návrhu, bezstratovo ladený Ethernet a bežný sieťový stack, ktorý používa zvyšok výpočtovej techniky – a majú rôzne nákladové krivky, rôzne prevádzkové nároky a veľmi odlišné správne odpovede v závislosti od toho, čo vlastne staviate.

Tento článok prechádza tým, čo každý z nich predstavuje, kam v roku 2026 skutočne pôjde latencia a peniaze a kde je hranica medzi „potrebujeme RDMA“ a „potrebujeme RDMA a konkrétne InfiniBand“. Na záver uvádzame plochú rozhodovaciu maticu.

Publikum: ľudia, ktorí určujú veľkosť klastra s umelou inteligenciou s 2 až 32 uzlami a snažia sa rozhodnúť, či je položka pre prepínač InfiniBand úprimná alebo finančná. Pozrime sa na N01 , kde sú uvedené základné informácie o 25/100 GbE, N06 , kde je uvedený rozpočet na latenciu, N07 , kde sú uvedené smerovacie gombíky a N08, kde je uvedené praktické znázornenie RDMA.

Tri látky, čo každá z nich vlastne je

Natívne InfiniBand je účelovo vytvorená HPC štruktúra. Linková vrstva je navrhnutá bezstratová – riadenie toku na základe kreditov znamená, že odosielateľ nikdy neprenáša, pokiaľ prijímač nemá vyrovnávaciu pamäť, takže pakety sa pri preťažení nestratia tak, ako ich stráca Ethernet. Smerovanie je centralizované: každá štruktúra má správcu podsiete (adresu, ktorá opensm proces alebo vstavaný SM na spravovanom prepínači), ktorý priraďuje LID, vypočítava cesty a rekonfiguruje pri zmene topológie. Aplikačná plocha je rozhranie API pre slovesá – ibv_post_send, páry frontov, fronty na dokončenie, pamäťové oblasti – to isté API, ktoré si požičal aj zvyšok sveta RDMA.

V roku 2026 bude nasadená generácia NDR (400 Gb/s na port, ConnectX-7, prepínače Quantum-2). XDR (800 Gb/s, ConnectX-8, Quantum-X800) sa tento rok začne dodávať do hyperškálovacích a laboratórií umelej inteligencie; IBTA zverejnila špecifikáciu XDR v roku 2023 a kremík je teraz vo veľkom. Latencia prepínania prepínačov je na kremíku s prierezom NDR pod 100 ns – čo je najnižšia komerčne dostupná hodnota a za posledných dve desaťročia je najnižšia približne štvornásobne.

RoCEv2 (RDMA over Converged Ethernet, verzia 2) je rovnaké API rozhranie RDMA verbs, ktoré beží na UDP/IP cez Ethernet. Sieťová karta NIC je na ConnectX-7 alebo ConnectX-8... presne ten istý čip ako verzia InfiniBandu — príznak firmvéru (LINK_TYPE_P1 = 1 pre IB, 2 pre Ethernet) prepína medzi režimami. Čo nie je zadarmo: Ethernet je štandardne stratový a RDMA predpokladá bezstratový prenos. Nasadenie RoCE teda vyžaduje, aby sa štruktúra správala ako InfiniBand na linkovej vrstve, čo znamená Priority Flow Control (PFC) pre krátkodobé núdzové brzdenie, ECN pre signál dlhodobého preťaženia a riadiacu slučku ako DCQCN, ktorá ich spája. To je konfiguračná práca – a prevádzkové riziko – ktoré oddeľuje RoCE od obyčajného Ethernetu. Pri správnom použití sa RoCEv2 nachádza na dosah latencie InfiniBand: 1.5 – 2.5 µs RDMA RTT na rovnakom prepínači oproti ~1 µs pre IB.

Zvyšok planéty je obyčajný TCP/IP Ethernet . Sockets API, sieťový stack jadra, žiadny RDMA, žiadna záruka bezstratového prenosu. Výkon sa pohybuje v pásme latencie 10–30 µs/cesta na N06 , priepustnosť je v poriadku s rýchlosťou linky NIC pre hromadný prenos a CPU je na dátovej ceste. Toto je správna štruktúra pre správu prevádzky, sťahovanie modelov, telemetriu a gigabitovú rýchlosť medzi vaším robotom a inferenčným serverom. Je to nesprávna štruktúra pre synchrónny gradient AllReduces naprieč 16 GPU.

Porovnanie titulkov

Majetok InfiniBand NDR RoCEv2 (100 GbE) Obyčajný TCP 100 GbE
Rýchlosť na port (mainstream 2026) 400 Gb/s 100–400 Gb/s 100 Gb/s
RTT s rovnakým prepínačom RDMA, 64 B ~1 µs 1.5 – 2.5 µs neuvedené (bez RDMA)
Latencia prepínania skokov <100 ns 400–600 ns 400 ns – 3 µs
Sockety RTT (zásobník jadra) n / a n / a 20 – 60 µs
Bezstratová linková vrstva Áno, zámerne Naladený (PFC + ECN) Nie
Smerovanie SM, deterministický ECMP + adaptívne ECMP / štandard L2/L3
kremík sieťovej karty ConnectX-7/8 ConnectX-7/8 (rovnaký čip) Každý
Relatívne náklady na port ~$$$ ~$$ ~$
Prevádzková zložitosť Stredná (SM, ale málo gombíkov) Vysoká (ladenie PFC/ECN/DCQCN) Nízky
Koncentrácia dodávateľov Iba NVIDIA NVIDIA, Broadcom, AMD/Pensando, Cisco, Arista Niekto

Riadok s nákladmi čítajte ako relatívny, nie absolútny. Skutočný rozdiel na prepínačoch je zhruba 2–3× na port pre prepínač InfiniBand NDR oproti ekvivalentnému ethernetovému prepínaču s umelou inteligenciou (Spectrum-X, Tomahawk 5/6). Samotná sieťová karta je v podstate rovnaký hardvér v oboch režimoch; rozdiel je v licencii a v zmluve o podpore.

Kam smeruje latencia

N06 rozdeľuje jeden spiatočný cyklus RDMA na mikrosekundy. Skrátená verzia, relevantná pre toto porovnanie:

hop InfiniBand NDR RoCEv2 100 GbE Obyčajný TCP 100 GbE
NIC TX (slovesá) 0.3 – 0.5 µs 0.3 – 0.5 µs n / a
Switch hop (single) <0.1 us 0.4 – 0.6 µs 0.4 – 3 µs
Drôt (10 m) 50 ns 50 ns 50 ns
NIC RX 0.3 – 0.5 µs 0.3 – 0.5 µs n / a
Jednosmerný protokol TCP/IP jadra n / a n / a 10 – 30 µs
Aplikácia (memcpy, serializácia) 0.1 – 1 µs 0.1 – 1 µs 1 – 10 µs
Úplne jednosmerný, jeden prepínač ~1 µs ~1.2–2 µs ~15–40 µs

InfiniBand vyhráva v latencii ASIC prepínačov – to je medzera, ktorá sa ešte nezatvorila. Moderné ethernetové prepínače s umelou inteligenciou (Spectrum-X SN5600 / Tomahawk 5) dosahujú počet preskokov v rozsahu 400 – 600 ns, čo je dostatočne konkurencieschopné, takže v rámci dvojskokového listu-dvojitého chrbta je absolútny rozdiel rádovo 1 µs. To je dôležité pre tesné tenzorovo paralelné kolektívy. Nezáleží na tom pre čítania z úložiska alebo dávkovú inferenciu.

Ľudí, ktorí poznajú latenciu iba zo soketov, desí stĺpec s obyčajným TCP. Cena jadra 10 – 30 µs/cesta je za paket; pri malom súbore správ s mnohými okružnými cestami sa rýchlo akumuluje. NCCL cez TCP je funkčné, ale je to až posledná možnosť.

Šírka pásma a realita sieťovej karty

V roku 2026 rovnaká rodina kariet pokrýva InfiniBand aj RoCE:

NIC režim Na port PCIe
ConnectX-6 Dx IB HDR / RoCE 100 GbE 200 / 100 Gb/s Gen4
ConnectX-7 IB NDR / RoCE 400 GbE 400 Gb/s Gen5
ConnectX-8 SuperNIC IB XDR / RoCE 800 GbE 800 Gb/s Gen6
BlueField-3 DPU IB NDR / RoCE 400 GbE + offload 400 Gb/s Gen5
Broadcom Thor 2 / Thor 3 Iba Ethernet RoCE až 800 Gb/s Gen5/6
AMD Pensando Pollara 400 RoCE / Ultra Ethernet 400 Gb/s Gen5

Titulok: karta ConnectX-7, ktorú si kúpite pre IB, je rovnaká karta, akú by ste si kúpili pre RoCE. Katalógová cena začiatkom roka 2026 sa pohybuje okolo 1 500 – 2 200 EUR za jednoportový NDR; variantná SKU iba predkonfiguruje firmvér. Preto „prechod z IB na RoCE“ nie je vo väčšine klastrov opätovným nákupom sieťovej karty – ide o zmenu firmvéru, výmenu transceivera a zmenu prepínacej štruktúry.

Na strane AMD je Pensando Pollara 400 (teraz dodávaná s platformami MI300X/MI325) prvou dôveryhodnou sieťovou kartou RDMA od inej spoločnosti ako NVIDIA s produkčným nasadením umelej inteligencie. Spoločnosť Broadcom v roku 2025 oznámila sieťovú kartu 800G s umelou inteligenciou (generácia Thor Ultra / Thor 3). Po prvýkrát za desať rokov nie je trh s sieťovými kartami RDMA obmedzený na jedného dodávateľa.

Prepínače: kde sú peniaze skutočne

Cena sieťovej karty je vo všetkých režimoch zhruba rovnaká. Prepínač nie.

Prepnúť triedu kapacita Približný zoznam, na port, 2026
NVIDIA Quantum-2 QM9700 (64× 400G NDR IB) 51.2 Tb/s $$$$ (~3× ekvivalent Ethernetu)
NVIDIA Quantum-X800 (XDR IB) 115.2 Tb/s $$$$$
NVIDIA Spectrum-X SN5600 (64× 800G Eth) 51.2 Tb/s $ $ $
Referenčný Broadcom Tomahawk 5 (51.2 Tb/s) 51.2 Tb/s $$
Broadcom Tomahawk 6 (102.4 Tb/s) 102.4 Tb/s $$$ (novšie, prémiové)
Generický 100 GbE list (trieda dátových centier) 6.4 – 12.8 Tb/s $

2–3-násobná prémia na port pre InfiniBand je už roky stabilná. Sú to reálne náklady: 64-portový NDR prepínač Quantum-2 sa pohybuje v rozmedzí 120 000 až 180 000 eur v závislosti od optiky a podpory; 64-portový Spectrum-X SN5600 s podobným počtom portov sa pohybuje okolo 60 000 až 90 000 eur; generický Tomahawk 5 whitebox od taiwanského výrobcu OEM môže stáť polovicu tejto ceny. Pridajte optiku – transceivery OSFP NDR stoja 600 až 1 200 eur za kus pri objeme – a delta „celkového predaja“ na port sa ešte viac rozšíri.

Kde sa nerozširuje tak , ako ľudia očakávajú: AOC (aktívne optické káble) a DAC (priame pripojenie medených káblov) pre inštalácie v racku. 3 m DAC stojí v oboch ekosystémoch približne 100 – 200 €. Vysoký účet za optiku sa objaví až vtedy, keď prekročíte vzdialenosť približne 5 m a potrebujete vysielače a prijímače SR/LR na oboch koncoch.

Uhol pohľadu Spectrum-X: NVIDIA predstavuje „AI Ethernet“

Strategickou odpoveďou spoločnosti NVIDIA na prechod na Ethernet je Spectrum-X – balík kremíkových prepínačov Spectrum-4 (a teraz Spectrum-5), sieťových kariet BlueField/ConnectX a komplexného riešenia pre riadenie preťaženia, ktoré nazývajú „adaptívne smerovanie + vyvažovanie záťaže založené na telemetrii“. Marketingové tvrdenie hovorí, že Spectrum-X poskytuje výkon AllReduce triedy InfiniBand na Ethernete, overený na skutočných tréningových záťažiach umelej inteligencie.

Nameraná realita, z vlastných benchmarkov spoločnosti NVIDIA a od tretích strán:

  • Spectrum-X zmenšuje približne 80 – 90 % rozdielu vo výkone AllReduce oproti InfiniBand NDR pri pracovných záťažiach NCCL. Zostávajúci rozdiel tvoria malé správy a najhoršie možné správanie.
  • Tajnou prísadou je adaptívne smerovanie na paket (rozdeľuje pakety cez viacero ciest a mení poradie u prijímača). Štandardný ECMP hašuje celé toky, čo pri malom počte tokov vytvára kritické miesta pri AI. Spectrum-X porušuje predpoklad hašovania toku.
  • Funguje to iba ako zásobník. Zmiešajte sieťovú kartu od inej firmy ako NVIDIA s prepínačom Spectrum a adaptívna smerovacia telemetrická cesta sa preruší. Toto je kompromis v uzamknutí – opustíte ekosystém InfiniBand, len aby ste sa doňho opäť dostali cez Ethernet.

Úprimné znenie: Spectrum-X je skutočným inžinierskym riešením skutočného problému. Taktiež udržiava NVIDIA v obraze o každej vrstve klastra AI, čo je presne to, čomu sa hyperškálovači vyhli pomocou Ethernetu. Či je to správne rozhodnutie, závisí od toho, či zostávajúci rozdiel vo výkone 10 – 20 % stojí za dodatočnú slobodu integrácie, ktorú sa vzdávate.

Riešením, ktoré neponúka NVIDIA, je Ultra Ethernet – špecifikácia UEC 1.0 publikovaná v roku 2025, ktorú podporujú spoločnosti AMD, Broadcom, Cisco, HPE, Intel, Meta a Microsoft. Doručovanie viacerých ciest, vyvažovanie záťaže na úrovni paketov, riadenie preťaženia v sieti, otvorené API. Pensando Pollara a Broadcom Thor 3 sú prvé sieťové karty, ktoré dodávajú UEC. Od polovice roka 2026 ide o dôveryhodnú cestu Ethernet pre umelú inteligenciu od rôznych dodávateľov, ktorá nevyžaduje komplexný balík NVIDIA.

Kontext hyperškálovacieho riešenia (a čo to znamená pre nás ostatných)

Hlavný titulok z posledných dvoch rokov: hyperškálovatelia z veľkej časti opustili InfiniBand. Meta vyškolila Llama 3 namiesto RoCE. AI fabric od AWS je Ethernet end-to-end. TPU pody od Googlu boli vždy vlastné, ale ich flotily GPU sú zapojené do Ethernetu. Microsoft Azure prevádzkuje mix a v nových zostaveniach výrazne investuje do Ethernetu. Približne 70 % nových nasadení infraštruktúry AI začiatkom roka 2026 si vybralo Ethernet pred InfiniBandom, podľa zverejnených výsledkov spoločnosti Broadcom, čo je obrat oproti ~80 % podielu InfiniBandu v roku 2023.

Metin publikovaný záver bol jednoznačný: správne naladené RoCEv2 a InfiniBand poskytujú ekvivalentný tréningový výkon pri svojich pracovných zaťaženiach. Zmena sa netýka surového výkonu – ide o to, kto vlastní kremík, kto obsadzuje SRE, ako sa súčiastky získavajú a či sa prevádzkový model integruje so zvyškom dátového centra.

Pre nás ostatných, ktorí nepoužívame tréningové štruktúry s 10 000 GPU, sú dôležité tri veci:

  1. Otázka „Ethernet dokáže umelú inteligenciu“ je vyriešená. Môže. RoCEv2 s moderným kremíkom s umelou inteligenciou a správnou kontrolou preťaženia je produkčnej kvality. Hyperškálovače to dokázali. Už nemusíte obhajovať svoj výber v RFQ.
  2. Prevádzkové znalosti sa s kremíkom posunuli. Pred piatimi rokmi boli vo vašej krajine traja ľudia, ktorí dokázali vytvoriť InfiniBand fabric a jeden, ktorý dokázal správne naladiť PFC/DCQCN na RoCE. Dnes sú zručnosti v oblasti RoCE oveľa rozšírenejšie a zručnosti v oblasti InfiniBand sú sústredené v HPC laboratóriách a u partnerov NVIDIA. Podľa toho plánujte personálne obsadenie.
  3. Príbeh o závislosti od dodávateľa sa obrátil naruby. InfiniBand vždy pochádzal od jedného dodávateľa (NVIDIA, predtým Mellanox). Ethernet bol otvorenou alternatívou – až kým Spectrum-X neprišiel s komplexnou ponukou NVIDIA aj na Ethernet. Skutočne nezávislým riešením z hľadiska dodávateľa je v roku 2026 RoCE triedy UEC s kremíkom Broadcom alebo AMD.

Kedy je InfiniBand tou správnou voľbou

InfiniBand je správna odpoveď, keď je väčšina z týchto otázok pravdivá:

  • Vyhradený tréningový klaster, 16+ uzlov, spustenie synchrónneho gradientu AllReduces s trvalou rýchlosťou. Výhoda latencie na konci s malým kolektívom sa prejavuje v tisíckach iterácií.
  • Aj tak si kupujete systémy NVIDIA HGX alebo DGX. Tieto základné dosky sú navrhnuté pre NDR/XDR. Kombinácia Ethernetu na uzle DGX je prevádzkovo nepraktická.
  • Máte odborné znalosti v zamestnancoch ktorý pozná správcu podsiete, vie čítať ibtracert výstup a je spokojný so správou UFM od spoločnosti NVIDIA.
  • Rozpočet podporuje 2–3-násobnú prémiu na port prepínača. bez narušenia ekonomiky klastra.
  • Klaster je celým účelom budovy. Čisté nasadenie HPC/AI bez zdieľaných úložných zariadení a bez aplikačnej prevádzky – InfiniBand zjednodušuje prevádzkový model, pretože nie je potrebné argumentovať QoS.

Ak tri z týchto piatich popisujú vašu konštrukciu, InfiniBand si svoju cenu zaslúži. Ak to zodpovedá iba jeden, platíte za látku optimalizovanú pre problém niekoho iného.

Keď je RoCEv2 pragmatickým rozhodnutím

RoCE je správnou odpoveďou pre najväčšiu skupinu zákazníkov spoločnosti Kentino:

  • 4 až 16 uzlov, zmiešané pracovné zaťaženie, trénovanie, inferencia a ukladanie na rovnakej štruktúre.
  • Nízky rozpočet, ale vyžaduje RDMA. Klaster vykonáva dostatok viacuzlového trénovania alebo distribuovanej inferencie, takže zaťaženie jadra obyčajným TCP je neprijateľné, ale prémiový prepínač InfiniBand áno.
  • Zdieľaná infraštruktúra s prevádzkou bez umelej inteligencie. Prevádzka, úložisko a prístup vývojárov sú riadené rovnakou ethernetovou vrstvou. RoCE existuje s tým koexistenciou; InfiniBand potrebuje vlastnú fyzickú vrstvu.
  • Chcete možnosť výberu dodávateľa. Kombinujte prepínače Broadcom so sieťovými kartami NVIDIA s uzlami AMD MI300. Ekosystém Ethernet to umožňuje; ekosystém InfiniBand nie.
  • Tím už má rozsiahle operačne rozvinuté siete Ethernet. Ladenie PFC/ECN je skutočná práca, ale je to práca na substráte, ktorý už každý pozná. SM vo vašej hlave je riadiaca rovina L2/L3, ktorú používate už roky.

Pasca na označenie: Nesprávne nakonfigurovaný RoCEv2 je horší ako obyčajný TCP. Búrky PFC pauzy cez nesegmentovanú sieť môžu zničiť rovinu riadenia. Nesprávne nastavené prahy ECN vytvárajú sieť, ktorá vyzerá zdravo pri perftest, ale pri skutočnom AllReduce incaste sa zrúti. Podľa N08 ide o varovanie „ručné nastavenie konfigurácie PFC na generickom bielom rámčeku je projekt“. Nakupujte od dodávateľa s overenými šablónami RoCE (NVIDIA Spectrum-X, Arista, Cisco Nexus 9000 s profilom služby AI siete) alebo si najmite niekoho, kto to už urobil.

Keď stačí obyčajný Ethernet TCP/IP

Obyčajný Ethernet – žiadne RDMA, žiadne PFC, žiadne ladenie DCQCN, len sockety a kernel stack – je správnou odpoveďou častejšie, než si ľudia pripúšťajú:

  • Jednouzlový server s 4× alebo 8× GPU. Prevádzka medzi grafickými procesormi zostáva na PCIe alebo NVLink vo vnútri šasi. Jedinou úlohou siete je prenos tréningových dát, modelovanie váh a telemetria. 25 GbE alebo jeden 100 GbE link je v poriadku.
  • Inferenčné klastre s ľahkou koordináciou medzi uzlami. Latencia na požiadavku je dominantne ovplyvnená výpočtami GPU; 10 µs siete je šum.
  • Laboratórium so zmiešaným využitím, robotický pracovný stôl, vývojové prostredie. Klaster nespúšťa trvalé synchrónne trénovanie. RDMA je prehnané.
  • Nastavenia edge-AI pre robotiku ako je opísané v I01 — robot komunikuje s jedným inferenčným serverom, latencia je v stovkách milisekúnd, štruktúra je neviditeľná.

Úprimné odporúčanie pre väčšinu zákazníkov spoločnosti Kentino: ak si kupujete jednu grafickú kartu K-AI 256 Turin Dual s 8× RTX 5090, nepotrebujete InfiniBand a dokonca ani RoCE. Dvojica 100 GbE pripojení k štandardnému prepínaču dátového centra, povolené jumbo snímky, predvolené ladenie jadra – to je správna odpoveď a stojí o päťcifernú sumu menej ako alternatíva.

Čestný Kentinov pohľad

Predávame zákazníkom, ktorí budujú klastre s 1 až 8 uzlami s grafickými kartami pre spotrebiteľov a pracovné stanice (5090, 4090, RTX Pro 6000 Blackwell). Nie pre hyperscale trh, nie pre HPC trh. Pre túto rozlohu:

  • Jednouzlová 8-GPU krabica: obyčajná 25/100 GbE. Hotovo. Žiadne RDMA, žiadne zaťaženie fabric. Zaujímavá šírka pásma je vo vnútri šasi na PCIe Gen5; vonkajšie prepojenie slúži na príjem a správu dát.
  • Klaster s 2 až 4 uzlami s občasným distribuovaným tréningom: RoCEv2 na 100 GbE so šablónou prepínača s umelou inteligenciou podporou dodávateľa. Spectrum-X, ak chcete cestu overenú spoločnosťou NVIDIA; Tomahawk 5 / Arista, ak chcete cestu s viacerými dodávateľmi. Naplánujte si dva týždne na správne nastavenie PFC/ECN a nccl-tests validácia.
  • 4- až 8-uzlový klaster s trvalým trénovaním: RoCEv2 na 200 alebo 400 GbE s úplne oddelenou rovinou riadenia. Toto je ideálny bod pre krivku nákladov na port; rozdiel oproti IB v tomto rozsahu nestačí na odôvodnenie prémie za prepínač, pokiaľ pracovná záťaž nie je nezvyčajne citlivá na latenciu.
  • Nad 8 uzlami, trvalý tréning s intenzívnym využívaním AllReduce: InfiniBand si začína zaslúžiť pozornosť. Nie automatické – zmerajte si to. Ale pri tejto veľkosti stojí za skutočné peniaze prevádzková jednoduchosť typu „fabric je bezstratový, SM zvláda smerovanie, NCCL jednoducho funguje“.
  • Čokoľvek skutočne v mierke DGX: my nie. Kúpte si HGX a prijmite balíček InfiniBand.

Čo urobiť ďalej

Rozhodovacia matica, ktorá ukončuje väčšinu týchto rozhovorov:

Otázka Ak áno Ak nie
Je to server s jedným uzlom alebo dva uzly, ktoré pracujú nezávisle? Obyčajný TCP, 25/100 GbE. Tu skončiť. Pokračovať.
Prevádzkujete synchrónne distribuované školenia (DDP / FSDP / Megatron)? Pokračovať. Stačí obyčajný TCP/100 GbE. Prestaň.
Má klaster celkovo ≤ 4 uzly? RoCEv2 na 100 GbE. Pokračovať.
Má klaster 4–16 uzlov, zmiešané pracovné zaťaženie a zdieľanú infraštruktúru? RoCEv2 na 100/200/400 GbE so Spectrum-X alebo Tomahawk 5/6. Pokračovať.
Má klaster viac ako 16 uzlov, špecializované školenie AI a rozpočet NVIDIA? InfiniBand NDR / XDR. RoCEv2 je stále obhájiteľný.
Máte vo svojom tíme odborníkov na InfiniBand? IB je prevádzkovo lacnejší. Lean RoCEv2; trh so zručnosťami v oblasti Ethernetu je oveľa hlbší.
Bude tá istá štruktúra prenášať prevádzku bez umelej inteligencie (úložisko, správa, vývoj)? RoCEv2; IB vyžaduje samostatný fyzický závod. IB je čistejší, ak to rozpočet dovolí.

Ak hodnotíte zostavu a nie ste si istí, postup je nasledovný:

  1. Profil pracovnej záťaže. Aká časť celkového behu je v medziuzlových kolektívoch oproti výpočtom na jednom uzle? Ak je to menej ako 10 % behu, výber štruktúry sotva pohne ihlou.
  2. Zhluk si poctivo zvoľte veľkosť. 2 uzly nie sú rovnaký problém ako 16 uzlov. Počet uzlov určte pred začatím výroby látky.
  3. Porozprávajte sa s dvoma dodávateľmi prepínačov. Získajte skutočnú cenovú ponuku na port vrátane optiky. Prémia 2–3× InfiniBand nie je teoretická a nezobrazuje sa v marketingových materiáloch.
  4. Naplánujte si riadiacu rovinu samostatne, za N08Debata o dátovej štruktúre odvádza pozornosť od skutočnosti, že na fungovanie potrebujete aj 10 GbE sieť na správu, ktorá nie je závislá od štruktúry umelej inteligencie.
  5. Ak RoCE: vyčleňte dva týždne na prípravu klastra na ladenie PFC/ECN/DCQCN. Pre N08, tu klastre RoCE žijú alebo umierajú.

Nasledujúce články sa zaoberajú základmi káblových sietí ( N01 ), rozpočtom latencie, z ktorého vyplýva výber ( N06 ), zložitosťou smerovania a riadenia preťaženia ( N07 ) a praktickým zavádzaním RDMA bez ohľadu na štruktúru siete ( N08 ). Sekcia K sa zaoberá témami na úrovni klastrov – distribuované trénovanie (K02), inferenčné klastre (K03) – ktoré predpokladajú, že toto rozhodnutie už bolo prijaté.

InfiniBand je v tom, čo robí, vynikajúci. RoCEv2 dobehol väčšinu nových riešení dostatočne na to, aby zvíťazil v oblasti nákladov a ekosystému. Obyčajný Ethernet je nenápadnou správnou odpoveďou pre najväčší počet kupujúcich. Vyberte si ten, ktorý vaša pracovná záťaž skutočne potrebuje, nie ten, ktorý odporúča dodávateľ.


Toto je súčasť Kentino Wiki, referenčnej série o výpočtoch s využitím umelej inteligencie a systémoch, ktoré ju prepájajú. Opravy sú vítané na adrese info@kentino.com.