Úrovne úložiska na serveri AI: Model, Dataset, Scratch, Checkpoint
S kupujúcimi sa opakovane rozprávame o NVMe. Žiadajú „čo najrýchlejšie“, pretože v technických listoch sa uvádza 14 GB/s na disku Gen5 a 4090 vedľa Samsungu 9100 PRO znie zhodne. Potom sa pýtame, na čo je tá krabica určená, odpoveď znie „väčšinou inferencia“ a správna zostava sa ukáže byť s jedným diskom namiesto ôsmich. Úložisko v serveri s umelou inteligenciou je tou časťou špecifikácie, kde je nadmerné nakupovanie jednoduché, pre dodávateľa bezbolestné a pre pracovnú záťaž takmer úplne neviditeľné.
Tento článok sa zaoberá štyrmi skutočnými úložnými vrstvami v jednom serveri s umelou inteligenciou, čo každá z nich v skutočnosti robí, ako bude vyzerať trh s NVMe v roku 2026, kedy si Gen5 zaslúži svoju prémiu, prečo hardvérový RAID prestal byť pre NVMe dôležitý a ako dimenzovať každú vrstvu bez míňania peňazí. Výber súborového systému je samostatnou otázkou, ktorou sa zaoberá L04; úložisko zdieľané v klastri (NFS, BeeGFS, Lustre, objektové úložiská) je K04. Tu zostávame vo vnútri šasi.
Štyri úrovne úložného priestoru
Seriózny server s umelou inteligenciou má štyri odlišné úložné úlohy. Majú veľmi odlišné profily veľkosti, priepustnosti, výdrže a nákladov. Zaobchádzanie s nimi ako s jedným fondom je prvou chybou.
| Stupeň | Úloha | Potreba priepustnosti | Potreba vytrvalosti | Typická veľkosť |
|---|---|---|---|---|
| Modelka | Koreň operačného systému, knižnica váh modelu, obrazy kontajnerov | Čítanie náročné, skromné | Nízka (väčšinou na čítanie) | 1–4 TB |
| dataset | Tréningové dáta, dolaďovanie korpusov | Sekvenčné čítanie, vysoké | Nízka až stredná | 10 TB – 200 TB |
| Poškriabaniu | Únik aktivácií, vyrovnávacia pamäť dátových súborov, dekódované úlomky | Čítanie + písanie, veľmi vysoká | Stredne vysoké (zmiešané) | 2–8 TB |
| kontrolný bod | Stav modelu počas trénovania, periodické snímky | Bursty veľké zápisy | Stredná (pre zápisy) | 5–20 TB |
Inferenčný server so 4 GPU zvyčajne potrebuje iba prvú vrstvu a možno aj časť druhej. Tréningový box s 8 GPU potrebuje všetky štyri a tie štyri chcú rôzne disky. Otázka „koľko TB NVMe?“ je bez výberu vrstvy bezvýznamná.
Úložisko modelu
Modelová vrstva je miestom, kde sa nachádza vaša knižnica váh – všetky varianty Llama, Qwen, Mistral, Stable Diffusion, Flux, Whisper, ktoré očakávate, že sa načítajú. Je to tiež miesto, kde sa nachádza operačný systém, obrazy kontajnerov, prostredia conda a binárne súbory inference servera. Vo väčšine zostavení sa tieto súbory zbalia na bootovací disk.
Veľkosť je funkciou počtu modelov, ktoré máte v zariadení. Niekoľko príkladov bežných kvantizácií:
- Lama 3 70B Q4: ~40 GB
- Lama 3 70B FP8: ~70 GB
- Qwen2.5-VL 72B Q4: ~45 GB plus niekoľko GB pamäte Vision Tower
- Mistral Large 2 (123B) Q4: ~70 GB
- Lama 4 Maverick MoE FP8: ~250 GB
- Skromná knižnica VLM (8 modelov, zmiešané kvantizácie): 300–500 GB
- Výskumné laboratórium, ktoré udržiava 30 modelov v prevádzke: 2–4 TB
Prevažne na čítanie. Model sa načíta raz pri spustení procesu a po zvyšok dňa zostáva vo VRAM. Disk pri spustení vLLM sekvenčne načíta 40 GB, potom je prevažne nečinný. Jeden 2–4 TB Gen4 NVMe – dokonca aj spotrebiteľský disk ako Samsung 990 PRO – to zvládne bez námahy. Plaťte za kapacitu, nie za priepustnosť.
Úložisko dátových súborov
Dátová množina je miestom, kde sa nachádzajú školiace korpusy a dolaďovacie materiály. Táto vrstva je tá, ktorú zákazníci chronicky podceňujú, pretože dátová množina, s ktorou pracujú dnes, im vyhovuje a zabúdajú, že tá ďalšia už nebude.
Realistické rozsahy:
- Jednodoménový korpus pre jemné doladenie LoRA: 10–100 GB
- Multimodálna sada na jemné doladenie (obrázky + text): 1–10 TB
- Textový korpus v predtréningovom rozsahu (podmnožina FineWeb atď.): 5–50 TB
- Sada videí na predtréning alebo demonštráciu robotiky: 20 – 200 TB
- Genomický, vedecký alebo zo scrapingového webového archívu: 100 TB – 1 PB+
Prístupový vzor je sekvenčné čítanie, opakované naprieč epochami, naprieč mnohými DataLoader workermi paralelne. Citlivé na priepustnosť (pretože GPU čaká), tolerantné na latenciu. Rýchlosť zápisu je v podstate nulová po umiestnení dát do fázy.
Pre súbory údajov nad ~10 TB správna odpoveď zvyčajne opúšťa šasi – pozri K04 pre vzory NFS, BeeGFS a objektového úložiska. Vo vnútri šasi je rozumná vrstva súborov údajov z pevných diskov v RAIDZ2 (lacné, veľké, pomalé, ale postačujúce po zahriatí vyrovnávacej pamäte stránok) alebo stredná úroveň U.2 NVMe RAID až do 50 TB.
Poškriabaniu
Scratch je neznámy hrdina. Absorbuje všetko, čo sa inam úplne nehodí: dekódované úlomky obrázkov, medziľahlé aktivácie vypustené ZeRO-Offloadom, vyrovnávacie pamäte dát vytvorené webdataset/DALI, dočasné premiešania dátových súborov, artefakty zostavenia kontajnerov a výpis havarovaného behu. Zároveň náročné na čítanie aj zápis.
Veľkosť: 2–8 TB je ideálna veľkosť. Menej ako 2 TB a jedno jemné doladenie to zaplní. Viac ako 8 TB a zvyčajne vytvárate malú vrstvu datasetu a nazývate ju scratch – fajn, ale priznajte si, čo robíte.
Výdrž je tu dôležitá spôsobom, akým to nie je v prípade ostatných úrovní. Scratch požiera zápisy – 5–20 TB zápisov denne nie je na intenzívne používanom tréningovom zariadení nezvyčajné. Podnikový disk s kapacitou 1 DWPD a kapacitou 4 TB umožňuje zápisy 4 TB denne počas piatich rokov; seriózny tréningový scratch potrebuje 1–3 DWPD, zmiešaného typu.
kontrolný bod
Kontrolný bod je úroveň, kde sa dostaneme do tréningového stavu. Bursty: desať minút ticho, potom 50 – 500 GB zapísaných za pár sekúnd a potom opäť ticho.
Kontrolný bod modelu 70B v FP16 má váhy ~140 GB. Pri FSDP, gradienty a stav optimalizátora posúvajú veľkosť kontrolného bodu na 400 – 700 GB. Pri DeepSpeed ZeRO-3 a plnom stave optimalizátora (Adam: 8 bajtov na parameter pre hlavný FP32 + prvý/druhý moment) môže kontrolný bod 70B dosiahnuť veľkosť blízkou 1 TB.
Trvalá rýchlosť zápisu jedného NVMe disku Gen5 je ~10–13 GB/s. Kontrolný bod s kapacitou 700 GB zapíše približne za minútu, optimisticky – if Každá hodnosť streamuje na svoj vlastný disk. Synchrónne, tréningové bloky pre danú minútu. Riešením je asynchrónne segmentované kontrolné stanovenie (popísané nižšie).
NVMe Gen4 vs. Gen5 – kedy sa prémiové riešenie oplatí
Trh s NVMe v roku 2026 je rozdelený medzi zrelú Gen4 (5 – 7 GB/s) a teraz mainstreamovú Gen5 (12 – 14 GB/s). Na vrchole spotrebiteľskej ponuky je Samsung 9100 PRO so sekvenčným čítaním 14.8 GB/s a sekvenčným zápisom 13.4 GB/s. Enterprise Gen5 je v rovnakej oblasti – Solidigm D7-PS1010 s rýchlosťou čítania 14.5 GB/s, Micron 9550 MAX s rýchlosťou čítania 14 GB/s, Kioxia CD8, SanDisk DC SN861 – všetky poskytujú rýchlosť čítania 13 – 14 GB/s a trvalého zápisu 8 – 10 GB/s.
Nákladová prémia pre Gen5 oproti Gen4 s porovnateľnou kapacitou v polovici roka 2026 bude 30 – 50 % na strane spotrebiteľa a 20 – 35 % na strane podniku.
Keď sa Gen5 skutočne vyplatí:
- Načítanie modelu zo studeného stavu. Model s 250 GB MoE sa načíta za 18 sekúnd na Gen5 oproti 36 sekundám na Gen4. To je dôležité, ak modely často meníte.
- Tréningové I/O operácie. Kanálový systém vizuálne dekóduje surové súbory JPEG z disku, multimodálne súbory údajov, kde je predspracovanie úzkym hrdlom.
- Pred asynchrónnou kópiou vyhľadajte kontrolný bod pre lokálny NVMe. Čím rýchlejšie je lokálne písanie, tým skôr sa obnoví školenie.
- Klasterový úložný server podporujúci 8+ tréningových uzlov. Agregovaný dopyt klientov prekračuje limit Gen4.
Keď je Gen4 v poriadku a Gen5 sú vyhodené peniaze:
- Inferenčné servery. Model sa načíta raz pri spustení; zvyšok dňa disk dosahuje jednocifernú rýchlosť MB/s.
- Koreňový adresár operačného systému a úložisko kontajnerov. Spúšťať raz mesačne, príležitostne inštalovať balíčky.
- Úroveň dátovej množiny, kde sú shardy preddekódované a veľké. PyTorch DataLoader s 8 pracovníkmi, ktorí čítajú úlomky WebDataset, dosahuje agregovanú saturáciu približne 4–6 GB/s; Gen4 to pokrýva.
Úprimná verzia: približne 70 % zákazníckych zostavení, ktoré dodávame, sú čisto inferencie a pre ne platí Gen4 NVMe všeobecne. Gen5 je rozhodnutie na úrovni tréningu.
Tvarové faktory — M.2, U.2/U.3, E3.S
| Tvarový faktor | Typické použitie | Hot-swap | Tepelný obal | Strop kapacity | Poznámky |
|---|---|---|---|---|---|
| M.2 2280 | Spotrebiteľ, topánka | Nie | 8 – 10 W | 8 TB | Škrtiace klapky pri trvalom Gen5 |
| M.2 22110 | Pracovná stanica, server | Nie | 12 – 15 W | 16 TB | Lepšia tepelná hmotnosť ako 2280 |
| U.2 / U.3 | Štandard pre dátové centrá | Áno | 25 W | 30 TB | Zrelé, široko kompatibilné |
| E1.S | Hustota hyperskalerov | Áno | 20 W | 16 TB | Tvar „pravítko“, hustota 1U |
| E3.S | Dátové centrum novej generácie | Áno | 25 – 40 W | 30+ TB | Určené pre termoprádlo Gen5/Gen6 |
M.2 Gen5 bude obmedzovať. Disk Samsung 9100 PRO s kapacitou 2 TB, ktorý v horúcom šasi udržiava rýchlosť 13 GB/s, dosiahne teplotu 75 °C a následne sa zníži jeho frekvencia. Modely vybavené chladičom s tým pomáhajú. M.2 je vhodný na bootovanie a mierne pracovné zaťaženie; nie je to však ten správny formát pre vrstvu s trvalým zápisom.
U.2 je pracant. Každý podnikový NVMe disk, ktorý Kentino dodáva v šasi Bone64c alebo Supermicro, je U.2, takmer univerzálne zameniteľný s backplanes U.3. 25 W tepelný obal, dva porty pre multipath, hot-swappable, kapacity 7.68 TB a 15.36 TB ponúkajú ideálny pomer ceny a hustoty.
E3.S je budúcnosť, pomaly. Navrhnuté od základov pre termálne systémy Gen5/Gen6. Pre zostavenie Kentino s jedným serverom alebo malým klastrom zostáva U.2/U.3 praktickou voľbou do roku 2026; E3.S prichádza na scénu pre obnovovacie cykly v roku 2027.
Neukladajte nosiče M.2 do horúceho šasi. Adaptéry PCIe, ktoré držia štyri disky M.2 za prepínačom, fungujú, ale v 4U serveri s ôsmimi grafickými procesormi je prúdenie vzduchu cez tieto nosiče slabé. Tepelné škrtenie pozorujeme do desiatich minút trvalého zaťaženia. Ak v serveri potrebujete štyri NVMe disky, použite U.2.
Výdrž – DWPD ako nákupný signál
| Trieda | DWPD | Prípad použitia | Nákladová prémia verzus načítanie. |
|---|---|---|---|
| Intenzívne čítanie | 0.3-1 | Bootovanie, úložisko modelu, dátová množina, archív | základné |
| Zmiešané použitie | 1-3 | Tréningové nulové body, kontrolné body, horúce kešky | +30 – 60 % |
| Intenzívne písanie | 3-10 + | Záznamy, denníky, databázy s vysokou zápisovou náročnosťou | +100 – 200 % |
Pre server s umelou inteligenciou je mapovanie jednoduché:
- Úroveň modelu: intenzívne čítanie, 0.3–1 DWPD.
- Úroveň dátovej množiny: intenzívne čítanie, 0.3–1 DWPD.
- Úroveň scratch: zmiešané použitie, 1–3 DWPD. Toto je úroveň, ktorá si zaslúži svoj rozpočet na vytrvalosť.
- Úroveň kontrolného bodu: zmiešané použitie, 1–3 DWPD. Hromadia sa pulzné zápisy; 1 DWPD na 4 TB disku umožňuje iba 4 TB/deň, čo prekračuje aj intenzívna tréningová kadencia.
Náročné na zápis (3+ DWPD) je pre takmer každú úlohu umelej inteligencie zbytočné. Kúpa nesprávnej úrovne odolnosti sa dá nahradiť výmenou; kúpa nesprávnej triedy priepustnosti často nie. Získajte správnu priepustnosť v čase zostavovania, berte odolnosť ako niečo, čo môžete vylepšiť.
RAID pre NVMe – hardvér je mŕtvy, softvér je riešením
Toto si zaslúži samostatnú podsekciu, pretože zákazníci sa stále pýtajú. Stručne povedané: ak má vaša zostava v roku 2026 hardvérový RAID radič pred NVMe diskami, je nesprávne nakonfigurovaný.
Hardvérové radiče RAID (LSI/Broadcom MegaRAID, Microchip SmartRAID, HPE Smart Array, Dell PERC) boli navrhnuté pre SAS/SATA. Integrovaný ASIC radiča spracováva paritu, ukladanie do vyrovnávacej pamäte a radenie príkazov do frontu a pri šírke pásma SAS (12 Gbit/s = 1.5 GB/s) má dostatok rezervy.
NVMe Gen5 s rýchlosťou 14 GB/s na disk saturuje RAID radič s jednou kartou po dvoch diskoch. Osem diskov za hardvérovou RAID kartou produkuje väčšiu šírku pásma, ako dokáže PCIe uplink karty preniesť. Radič sa stáva úzkym hrdlom a potom bodom zlyhania.
Praktickými odpoveďami sú softvér:
- mdadm (softvérový RAID pre Linux). Zrelé, v jadre, dobre podporuje RAID0/1/10. RAID5/6 na NVMe funguje, ale výpočet parity spotrebúva CPU. Pre 4 NVMe v zrkadle alebo stripe: perfektné.
- ZFS RAIDZ2. Lepší príbeh integrity (kompletné kontrolné súčty), lepšie nástroje na čistenie a nahrádzanie, sémantika snímok/klonov. Náročnejší na CPU ako mdadm. Správna voľba pre vrstvy archivácie a dátových súborov, kde je integrita údajov dôležitejšia ako maximálna priepustnosť.
- Replikácia / kódovanie vymazania na jednotku na aplikačnej vrstve. Pre veľmi veľké polia, striping MinIO/Ceph EC alebo BeeGFS úplne presúva rozhodovanie o redundancii mimo blokovej vrstvy.
Pre väčšinu zostavení Kentina:
- boot: 2× M.2 NVMe v mdadm RAID1.
- Škrabanec: RAID0 cez 2–4 NVMe (dáta sú obnoviteľné).
- Súbor údajov/kontrolný bod: RAID10 v mdadm alebo RAIDZ2 v ZFS.
Hardvérový RAID má v serveri s umelou inteligenciou presne jeden zostávajúci prípad použitia: malé bootovacie zrkadlo za základnou kartou Broadcom/MegaRAID na serveri, kde absolútne chcete bootovateľnú redundanciu pred operačným systémom. Aj tam funguje mdadm RAID1 s EFI na oboch diskoch bez problémov.
Sieťové úložisko pre vrstvu súboru údajov
| Pattern | sieť | Použiteľné na čítanie | Kedy je to správne |
|---|---|---|---|
| NFS cez 10 GbE | 10 GbE | ~ 1 GB / s | Malé laboratórium, jeden trenažér |
NFS cez 25 GbE s nconnect=8
|
25 GbE | ~ 2.5 GB / s | 1–2 školitelia, mierna miera dátových súborov |
NFS cez 100 GbE s nconnect=16
|
100 GbE | 8–10 GB/s | Multi-trainer, veľké súbory údajov |
| BeeGFS nad 100 GbE, 2–3 úložné ciele | 100 GbE | 30–60 GB/s | Tréningový klaster so 4–8 uzlami |
| Úložisko objektov (MinIO/Ceph) + lokálna fáza | 25/100 GbE | sa mení | Epizodické trénovanie, rozsiahle dátové jazero |
Ponaučenie: vrstva datasetu takmer vždy patrí mimo servera AI nad 10 TB. Vnútri šasi chcete rýchle scratchovanie, rýchly kontrolný bod a úložisko modelu; dataset môže byť vzdialený.
Ako PyTorch v skutočnosti načítava dáta
Užitočným modelom pre dimenzovanie úložiska je sledovať, čo robí PyTorch. DataLoader robí. S num_workers=8 a pin_memory=True:
- Osem pracovníkov spracováva každý otvorený súbor dát paralelne.
- Každý pracovník číta, dekóduje (JPEG, video snímky, prevzorkovanie zvuku) a tenzorizuje vzorku.
- Dekódovaný tenzor je umiestnený v zdieľanej pamäti.
- Hlavný proces čerpá zo zdieľaného frontu, pripája ho k hostiteľskej RAM a kopíruje ho do GPU cez DMA.
Praktické dôsledky:
- Kanál vízie je zriedka viazaný na úložisko Pokiaľ nie je súbor údajov taký veľký, vyrovnávacia pamäť stránok nemôže obsahovať pracovnú sadu.
- Predtréningový kanál LLM čítajúci predtokenizované shardy je na Gen4 často viazaný na úložisko. Gen5 pomáha. Rovnako pomáha aj umiestnenie aktívnej sady segmentov na lokálny NVMe namiesto NFS.
- Inferencia v podstate nikdy nie je viazaná na úložisko po načítaní modelu. Ukazovateľ aktivity disku na servírovacej krabici je plochý.
Útes kontrolného bodu
Kontrolný bod modelu 70B v FP16 má 140 GB váh. Pridajte stav optimalizátora Adam (~8 bajtov na parameter pre hlavný + prvý + druhý moment FP32): ~560 GB viac. Pridajte gradienty, ak vytvoríte snímku v polovici kroku: ~140 GB viac. „Kompletný“ kontrolný bod 70B môže dosiahnuť 800 GB až 1 TB v závislosti od toho, čo uložíte.
Synchrónny kontrolný bod zápisu všetkého v jednom poradí na jeden Gen5 NVMe s trvalou rýchlosťou zápisu 13 GB/s: ~75 sekúnd pre kontrolný bod 1 TB. Tréningové bloky počas celého trvania. Ak to robíte každých 100 krokov, keď každý krok trvá 5 sekúnd, znamená to, že ste práve spomalili trénovanie o 15 %.
Dve opravy, obe nevyhnutné:
1. Zdieľané kontrolné body. Každá úroveň FSDP zapisuje svoj vlastný shard na svoj vlastný lokálny NVMe disk. S 8 GPU a 8 lokálnymi diskami je zápis na úroveň 125 GB a zápisy sa vykonávajú paralelne. Nástenná frekvencia klesá na približne 10 sekúnd.
2. Asynchrónne kontrolné body. PyTorch DCP (torch.distributed.checkpoint) odloží zápis do vlákna CPU. GPU sa krátko zastaví pre kópiu GPU→CPU (na niekoľko sekúnd), potom sa trénovanie obnoví a samotný zápis do úložiska prebehne na pozadí.
Kombinácia – asynchrónne rozdelené – mení úložisko kontrolných bodov z „musí absorbovať 1 TB za sekundy“ na „musí držať krok s ustálenou kópiou na pozadí s rýchlosťou niekoľkých stoviek MB/s“. To zvláda takmer každá úroveň úložiska. Chyba, ktorej sa treba vyhnúť: synchrónne kontrolné body s plným stavom na úroveň zapisované priamo do NFS. To bolo v roku 2022 normálne. V roku 2026 je to nekalé praktiky.
Betónové úložné systémy K-AI
4-GPU inferenčný server (napr. K-AI 192 Genoa, 4× RTX 5090 alebo 4× RTX Pro 6000 Blackwell):
Boot + model: 1× 2 TB Gen5 M.2 NVMe (consumer or read-intensive enterprise)
Scratch: optional, often unnecessary for pure inference
Dataset: not needed on the box
Checkpoint: not needed on the box
Total: 2 TB NVMe. Cost: low. Sufficient for any inference workload.
Tréningový server s 8 grafickými kartami (napr. K-AI 256 Turin Dual, 8× RTX 5090 alebo 8× RTX Pro 6000):
Boot: 2× 480 GB M.2 NVMe, mdadm RAID1, ext4 → /
Model storage: 2× 4 TB U.2 Gen5 NVMe, mdadm RAID1, ext4 → /models
Scratch: 2× 8 TB U.2 Gen5 NVMe, mdadm RAID0, XFS → /scratch
Checkpoint: 2× 8 TB U.2 Gen5 NVMe, mdadm RAID10, XFS → /checkpoints
Dataset: NFS mount from external storage server, 100 GbE
Total local NVMe: ~36 TB. Cost: meaningful but matched to GPU spend.
Zdieľaný úložný uzol klastra (oddelený od výpočtového systému):
Boot: 2× 960 GB M.2 NVMe, RAID1, ext4
Hot tier: 12× 7.68 TB U.2 Gen5 NVMe, ZFS RAIDZ2 or BeeGFS storage target, XFS
Cold tier: 8× 16 TB SAS HDD, ZFS RAIDZ2 → /archive
Network: 2× 100 GbE, RoCE or NVMe-oF capable
Serves the cluster's dataset tier. See K04 for distributed FS choice.
Dve veci, ktoré si treba všimnúť. Inferenčný server má jeden pohonTréningový server má štyri vrstvy, ale každý disk je dimenzovaný pre svoju úlohu, nie je predimenzovaný tak, aby bol najväčší dostupný. Uzol klastrového úložiska je úplne samostatný počítač.
Úprimný názor – väčšina zákazníkov preháňa špecifikácie úložiska
Vzor, ktorý vidíme dostatočne často na to, aby sme si zaslúžili zmienku: zákazník si zostaví server s 8 grafickými procesormi, „aby bol pripravený na budúcnosť“, špecifikuje osem 15.36 TB U.2 NVMe diskov, pretože tam sú sloty, potom spustí inferenčné úlohy, ktoré sa dotýkajú možno 200 GB modelových súborov a zvyšok poľa navždy uvedie do nečinnosti. 25 000 EUR NVMe diskov je nečinných.
Pravidlá pre správnu veľkosť:
- Čistá inferencia, jeden server: Celkom 2–4 TB NVMe. Jeden disk. Hotovo.
- Inferencia plus občasné doladenie: Celkom 4–8 TB. Spustenie + odomknutie.
- Vážny tréning, jeden server: 16 – 40 TB v rámci bootovacieho/modelového/scratch/kontrolného bodu, s externou množinou údajov na NAS alebo v úložisku objektov.
- cluster: dátová sada a kontrolný bod sa presúvajú do zdieľaného úložiska; lokálne NVMe úložisko pre každý uzol sa zmenšuje späť na inferenčný profil (2 – 8 TB) pre bootovanie, modelovanie a spätný zápis.
Úložisko je jediné miesto v zostave umelej inteligencie, kde sa inštinkt „viac je vždy lepšie“ neustále mýli. Grafické procesory sa škálujú zhruba lineárne s nákladmi; RAM sa škáluje primerane; úložisko sa často vôbec neškáluje, keď máte dostatok kapacity.
Čo sa zlomí
Spôsoby zlyhania, ktoré vidíme v praxi, v tomto poradí:
- Bootovací disk je spotrebiteľský M.2 bez redundancie. Disk zlyháva po 18 mesiacoch, server sa nedá spustiť, modely zostávajú v bezpečí na RAID, ale prestavba je hračka. Oprava: 2× M.2 v mdadm RAID1, dokonca aj na inferenčných boxoch.
- Poškriabanie vyplní uprostred behu. Vyrovnávacia pamäť dátovej sady, dekódované shardy a dočasné súbory frameworku sa zhodujú. Oprava: monitor, alarm pri 80 % plnom naplnení, veľkosť 1.5 × najväčšia očakávaná pracovná sada.
- Hardvérová RAID karta za NVMe. Výkon je polovičný, aký by mal byť, ovládač je jediným bodom zlyhania, výmena je exotická. Oprava: vytrhnutie karty, mdadm alebo ZFS priamo.
- Synchrónny kontrolný bod k NFS, tréningové stánky. Oprava: asynchrónny segmentovaný kontrolný bod, najprv lokálny NVMe, potom asynchrónna kópia.
- Tepelná škrtiaca klapka Gen5 M.2. Disk s rýchlosťou 14 GB/s po 3 minútach nepretržitého zápisu zvládne rýchlosť 4 GB/s. Oprava: chladič, lepšie prúdenie vzduchu alebo prechod na U.2.
- Súbor údajov na úrovni súboru údajov saturuje Gen4. Tréningový kanál Vision je viazaný na 30 % úložného priestoru. Oprava: Vytvorenie Gen5 scratch, preddekódovanie do WebDataset alebo oboje.
-
ZFS ARC spotrebúva RAM určenú na trénovanie. Predvolená 50% alokácia OOM v tréningovom procese. Oprava: strop
zfs_arc_maxna 10–20 % RAM. Pozri L04.
Čo urobiť ďalej
Postup výberu veľkosti pred podpísaním zmluvy o výstavbe:
- Inferencia, tréning alebo oboje? Inferencia: prejdite na krok 5 s jedným nájazdom. Tréning: pokračujte.
- Aký je najväčší model, ktorý chcete trénovať alebo doladiť? Vynásobte počet parametrov počtom bajtov na parameter (FP16: 2, FP8: 1, BF16+stav optimalizátora: 16). To je minimálna plocha kontrolného bodu na snímku.
- S akou najväčšou dátovou sadou budete pracovať v nasledujúcich 12 mesiacoch? Do ~10 TB, umiestnite ho na lokálny NVMe v úrovni datasetu. Nad 10 TB patrí na NAS alebo do úložiska objektov – pozri K04.
- Budete robiť delené asynchrónne kontrolné stanovovanie? Ak áno (PyTorch DCP, NeMo, moderné frameworky), úložisko kontrolných bodov na uzol sa zmenší 4–8×. Ak to nie je možné, naplánujte si, že na každom uzle bude zobrazený úplný stav, a prispôsobte mu veľkosť.
- Vyberte si tvarový faktor. M.2 pre bootovanie. U.2/U.3 pre všetko ostatné v serverovom šasi. E3.S iba v prípade, že bolo šasi zakúpené na tento účel.
- Vyberte si vytrvalosť. 1 DWPD náročné na čítanie pre model a súbor údajov. 3 DWPD zmiešané použitie pre schvaľovacie a kontrolné body.
- Vyberte generáciu. Gen5, kde sa priepustnosť vypláca (nulový stav, kontrolné body, výmena modelov na multi-tenant boxoch). Gen4 všade inde.
- Rozhodnite sa pre RAID na úrovni operačného systému. mdadm pre malé polia, ZFS, kde záleží na kontrolných súčtoch, žiadny hardvérový RAID radič pred NVMe.
Krížová referencia: W01 o tom, ako sa veľkosť pamäte RAM vzťahuje na načítanie modelu z úložiska, W02 pre PCIe linku, ktorú spotrebúvajú lacné úložné jednotky.
Úložný priestor je tou časťou konštrukcie, kde sa zdržanlivosť vypláca. Najjednoduchšia konfigurácia, ktorá nepredstavuje úzke hrdlo, je takmer vždy tá správna.
Toto je súčasť Kentino Wiki, referenčnej série o umelej inteligencii, robotike a systémoch, ktoré ich spájajú. Komentáre a opravy sú vítané na info@kentino.com.