Ubuntu Pinning a správa ovládačov NVIDIA pre servery s umelou inteligenciou
Ak ste zodpovední za server s umelou inteligenciou, od ktorého závisia iní ľudia, najpravdepodobnejšou príčinou vášho ďalšieho výpadku nie je zlyhanie hardvéru, chyba modelu ani porucha napájania. Je to... apt-get upgrade že vy alebo vaša distribúcia bežala na pozadí, ktorá stiahla nové jadro, proti ktorému modul NVIDIA DKMS nedokázal čisto prestavať a ktoré zanechalo nvidia-smi vrátenie Failed to initialize NVML: Driver/library version mismatch pri ďalšom reštarte. To je najčastejší hovor s podporou Kentina po dvoch alebo troch mesiacoch prevádzky servera.
Tento článok je o tom, ako tomu zabrániť. Zaoberá sa tým, ktorý Ubuntu LTS si vybrať v polovici roka 2026, ako nainštalovať ovládač NVIDIA spôsobom, o ktorom viete skutočne uvažovať, ako zafixovať ovládač a jadro tak, aby bezobslužná aktualizácia nemohla potichu zničiť váš stack, a ako vykonať obnovu, keď to niekto aj tak urobil.
Publikum je ten, kto bude písať sudo na 4-GPU alebo 8-GPU boxe, ktorý má fungovať roky.
Prečo vôbec Ubuntu LTS
Existujú technicky zdatné linuxové distribúcie, ktoré nie sú Ubuntu – Debian stable, RHEL, Rocky, AlmaLinux, openSUSE Leap. Žiadna z nich nie je nesprávna a niektoré z nich sú pravdepodobne lepšie navrhnuté. Pre servery s umelou inteligenciou stále odporúčame Ubuntu LTS zo štyroch dôvodov, ktoré nemajú nič spoločné s eleganciou.
NVIDIA testuje najprv Ubuntu LTS. Ich apt úložiská loď cuda-keyring balíky explicitne pre ubuntu2204, ubuntu2404a (od jari 2026) ubuntu2604Sprievodca inštaláciou ovládača pomenúva Ubuntu LTS podľa čísla verzie; ostatné distribúcie sú uvedené v zadnej časti dokumentu.
Ekosystém kontajnerov predpokladá Ubuntu. Každý obraz NGC (nvcr.io/nvidia/pytorch, nvcr.io/nvidia/tritonserver, TensorRT-LLM) je postavený na báze Ubuntu LTS. Distribúcia hostiteľa nemusí zodpovedať kontajneru, ale ak áno, predpoklady jadra a používateľského priestoru sú v súlade.
Väčšina nástrojov pre umelú inteligenciu od tretích strán vo svojich súboroch README predpokladá Ubuntu. vLLM, llama.cpp, SGLang, pokyny na zostavenie FlashAttention, príklady Hugging Face Accelerate – všetky sú napísané a otestované najskôr v Ubuntu. RHEL funguje; vy budete ten, kto bude hlásiť problémy, keď to nefunguje.
Skupina ľudí, ktorí sa s vaším problémom stretli už predtým, je najväčšia na Ubuntu. Kedy nvidia-smi vráti nezmysel o 02:00, prvé tri zásahy Stack Overflow budú špecifické pre Ubuntu. Na tom záleží viac, než by malo byť.
Debian a RHEL nie sú zlou voľbou pre AI server. Ponúkajú menšie testovacie plochy, pomalšie validačné cykly NVIDIA a menšiu komunitu, keď sa niečo pokazí. Ak máte silný organizačný dôvod pre jeden z nich – izolovaný FedRAMP, existujúcu licenciu RHEL na webe alebo tím správcov systémov Debian shopu – použite ho. Ak nie, predvolene nastavte Ubuntu LTS.
22.04 oproti 24.04 oproti 26.04 v máji 2026
Tri vydania LTS sú dnes aktívne podporované. Úprimná matica:
| Verzia | Codename | Uvoľnený | Koniec štandardnej podpory | Predvolené nastavenie jadra | Podpora repozitárov NVIDIA | Odporúčania |
|---|---|---|---|---|---|---|
| 22.04 LTS | Jammy medúza | 2022-04 | 2027-04 | 5.15 / HWE 6.8 | plne | Len existujúca flotila; nenasadzovať nové |
| 24.04 LTS | Noble Numbat | 2024-04 | 2029-04 | 6.8 / HWE 6.11 | plne | Predvolené pre nové zostavy |
| 26.04 LTS | Odhodlaný mýval | 2026-04 | 2031-04 | 6.14 | Plná (predvolená hodnota R595) | Na produkciu počkajte do 26.04.1 (august 2026) |
Z toho stola sa oplatí vybrať niekoľko vecí.
Verzia 22.04 má stále najväčšiu inštalačnú základňu na svete a práve s ňou má NVIDIA najdlhšiu históriu validačného procesu. Ak máte funkčnú flotilu serverov verzie 22.04, neprepadajte panike a upgradujte. Je plne podporovaná do apríla 2027 so štandardnými aktualizáciami a Ubuntu Pro predlžuje bezpečnostnú údržbu do roku 2032, ak ju potrebujete. Ak však v polovici roka 2026 inštalujete nový server, vyberáte si operačný systém na ďalšie štyri až päť rokov. Verzia 22.04 má už len jeden rok štandardnej podpory. Nezačínajte tam.
Verzia 24.04 je ideálnym bodom pre produkciu umelej inteligencie v roku 2026. Prešla dvoma rokmi opravy chýb a revízií jadra HWE, pričom každá vetva ovládačov NVIDIA od R535 ďalej obsahovala balíky produkčnej kvality v balíkoch NVIDIA. ubuntu2404 V repozitári každý obraz NGC uvádza verziu 24.04 ako podporovanú základňu a máte čas do apríla 2029, kým sa štandardná podpora neskončí. Toto dnes nasadzujeme v nových zostaveniach Kentina.
Verzia 26.04 je čerstvo vydaná. Dodáva R595 ako predvolený ovládač v oficiálnom repozitári Ubuntu, po prvýkrát obsahuje CUDA v hlavných repozitároch a má dobré vylepšenia príbehu Wayland / NVIDIA, ktoré sú dôležité pre desktopy a vôbec nie pre servery s bezhlavou inferenciou. Rizikom pre server s umelou inteligenciou je načasovanie: v prvých troch až štyroch mesiacoch po... .0 Vydanie LTS, ubuntu-drivers Odporúčania a správanie modulov DKMS sa menia a vlastné repozitár spoločnosti NVIDIA trvá niekoľko cyklov, kým úplne overí každú vetvu ovládača voči novému jadru. Vzor z predchádzajúcich vydaní LTS (20.04, 22.04, 24.04) je taký, že prvé bodové vydanie — 26.04.1 v auguste 2026 – vtedy začínajú dávať zmysel nasadenia do produkčného prostredia. Ak môžete počkať, počkajte. Ak nemôžete, spustite dvojtýždňový test namáčania, než naň nainštalujete niečo dôležité.
Cesty inštalácie ovládača
Existujú tri spôsoby, ako nainštalovať ovládač NVIDIA na Ubuntu. Nie sú rovnako dobré.
ubuntu-drivers install je najjednoduchšia cesta. Canonical udržiava nástroj, ktorý analyzuje váš hardvér, vyberie vetvu ovládača, ktorú považuje za odporúčanú, a nainštaluje zodpovedajúci balík z archívu Ubuntu. Zabezpečí za vás podpisovanie Secure Boot (pomocou kľúča Canonical), pozná jadrá HWE a na počítači s jednou spotrebiteľskou GPU funguje dobre. Na serveri s umelou inteligenciou je to krehká cesta: odporúčaná vetva sa môže medzi vydaniami meniť. ubuntu-drivers-common balík, verzia, ktorú dostanete apt update Záleží to na tom, čo Ubuntu tento týždeň pribalilo, a máte menšiu kontrolu nad tým, ktorá vedľajšia verzia ovládača je na disku. Použite ho pre notebook. Nepoužívajte ho pre server.
apt z repozitára CUDA od spoločnosti NVIDIA je manuálna, ale kontrolovateľná cesta. Pridáte grafické karty NVIDIA cuda-keyring balík, ktorý nastavuje správne apt zdrojový kód pre vašu verziu Ubuntu a potom nainštalujte presne tie balíky, ktoré chcete – cuda-drivers-580, nvidia-driver-580, nvidia-dkms-580, žiadne prekvapenia. NVIDIA kontroluje balenie, vy kontrolujete verziu. Toto je predvolené nastavenie Kentina.
.run Inštalátor z developer.nvidia.com zapisuje súbory do /usr/local, spravuje vlastné prestavby modulov jadra a neintegruje sa s apt vôbec. Je to správna odpoveď v dvoch úzko špecifikovaných prípadoch: úplne nový hardvér, kde sa vetva ovládača, ktorú potrebujete, ešte nedostala do apt repozitár alebo pracovnú stanicu, kde aktívne vyvíjate alebo ladíte ovládač. V opačnom prípade je to nesprávna odpoveď. Bude bojovať s DKMS, nebude zachytený systémom apt-mark holda pri ďalšej aktualizácii jadra sa potichu zrúti, pretože cesta prestavby je teraz manuálna.
Konkrétne, na serveri 24.04 s novou inštaláciou je predvolená sekvencia Kentina:
wget https://developer.download.nvidia.com/compute/cuda/repos/ubuntu2404/x86_64/cuda-keyring_1.1-1_all.deb
sudo dpkg -i cuda-keyring_1.1-1_all.deb
sudo apt update
# Install the driver branch you actually want, by number.
sudo apt install -y cuda-drivers-580 nvidia-dkms-580
sudo reboot
Po reštarte, nvidia-smi mal by nahlásiť ovládač 580.x a maximálnu verziu CUDA, ktorú ovládač podporuje (CUDA 13 pre R580). To je celá inštalácia. Všimnite si, čo tam nie je: nie cuda meta-balík, č cuda-toolkit-13-0 (potrebné iba v prípade, že kompilujete kód CUDA na hostiteľskom počítači – pozri L02), č ubuntu-driversVybrali ste si verziu, nainštalovali ste si verziu a viete, čo je na disku.
Najdôležitejšie odvetvia v roku 2026
NVIDIA dodáva svoje ovládače pre Linux v pobočkách so špecifickými oknami podpory. Od polovice roka 2026:
| Vetva | Typ | Podpora CUDA | postavenie | Použiť pre |
|---|---|---|---|---|
| R535 | LTSB (Dlhodobá podpora) | CUDA 12.2 | Koniec života koncom roka 2026 | Iba migrácia |
| R550 | Výroba | CUDA 12.4 | EoL | Nepoužívajte pre novostavby |
| R570 | LTSB | CUDA 12.8 | Podporované do roku 2027 | Konzervatívne, predblackwellovské zameranie |
| R580 | Výrobná pobočka | CUDA 13.x | prúd | Predvolené pre nové zostavenia Kentina |
| R595 | Nová vetva funkcií | CUDA 13.x | prúd | Desktop / predvolená verzia 26.04; nejaký nový hardvér |
R580 je v roku 2026 správna predvolená verzia. Podporuje všetky grafické karty v rade Kentino (5090, 4090, RTX Pro 6000 Blackwell obe edície, L40, L4) vrátane architektúry Blackwell. sm_120 výpočtové kapacity a dodáva natívnu podporu CUDA 13 – čo je cieľ každého nedávneho vydania vLLM, PyTorch 2.10/2.11 a TensorRT-LLM. R570 je konzervatívna voľba LTSB, ak máte flotilu Ada (4090 / L40 / L4), ktorá nepotrebuje najnovšie funkcie a chcete vynechať prechod na inú vetvu ovládača na ďalší rok. R595 je to, čo Ubuntu 26.04 štandardne dodáva a čo chcete pre najnovší hardvér; na serveri, ktorý beží iba na tom, čo je dnes v zostave Kentino, je R580 konzervatívnejší a rovnako funkčný.
Tanec troch verzií Driver / CUDA / PyTorch
Tri nezávislé verzie musia byť zoradené. Nachádzajú sa na sebe takto:
PyTorch wheel (e.g. torch==2.11.0+cu130)
│ ships its own CUDA runtime, cuDNN, NCCL inside the wheel
▼
CUDA runtime version (here: 13.0)
│ the driver must support this CUDA version or newer
▼
NVIDIA driver branch (here: R580 → supports CUDA 13.x)
Pravidlo je, že ovládač podporuje maximálnu verziu CUDA runtime. Čokoľvek staršie ako toto maximum, na rovnakej hlavnej verzii, bude fungovať. Takže R580 (max CUDA 13.x) spúšťa PyTorch drivery postavené na 13.0, 13.1, 13.2; nespúšťa drivery postavené na (hypotetickej) CUDA 14.0, kým neaktualizujete vetvu ovládača. Staršie ovládače nemôžu spustiť novšiu CUDA – existuje dopredná kompatibilita pre niektoré karty dátových centier, ale je krehká a nie je to spôsob, akým chcete fungovať.
Praktická mapa toho, čo dnes beží na serveroch Kentino:
| Vetva vodiča | Max CUDA | Kolesá PyTorch | Obrázok vLLM | Dodáva natívnu CUDA v kontajneri |
|---|---|---|---|---|
| R570 (LTSB) | 12.8 | torch==2.6.x+cu128 |
vLLM 0.7 / 0.8 | 12.8 |
| R580 | 13.x | torch==2.10/2.11+cu130 |
vLLM 0.20+ predvolené | 13.0 / 13.1 |
| R595 | 13.x | rovnaké ako R580 | rovnaké ako R580 | rovnaký |
Vašou úlohou je opraviť ovládač a nechať všetko nad ním nasledovať. Ak všetko poskytujete z kontajnerov, nemusíte na hostiteľa vôbec inštalovať CUDA (a mali by ste – pozri L02). Hostiteľ potrebuje ovládač a sadu nástrojov pre kontajnery. To je všetko.
Pripnutie – najcennejší príkaz v tomto článku
Keď vodič nastúpi a nvidia-smi je šťastný, pripnite si ho. Pripnúť znamená povedať apt neaktualizovať, downgradovať ani odstraňovať konkrétne balíky, a to ani v prípade, že by sa ich závislosť alebo bezpečnostná aktualizácia dotkla. Príkaz je apt-mark hold.
# Pin the driver branch.
sudo apt-mark hold \
cuda-drivers \
cuda-drivers-580 \
nvidia-driver-580 \
nvidia-driver-580-server \
nvidia-dkms-580 \
libnvidia-compute-580 \
libnvidia-compute-580-server
# Pin the running kernel and its headers — DKMS needs both to rebuild,
# and a kernel jump that DKMS does not handle is exactly how you lose the GPU.
RUNNING=$(uname -r)
sudo apt-mark hold "linux-image-${RUNNING}" "linux-headers-${RUNNING}"
# If you are on the Ubuntu HWE kernel meta-package, hold that too:
sudo apt-mark hold linux-generic-hwe-24.04 linux-image-generic-hwe-24.04 linux-headers-generic-hwe-24.04
# Verify.
apt-mark showhold
To je zhruba polovica každého vyriešeného hovoru typu „môj server s umelou inteligenciou prestal fungovať“. Kedy apt update && apt upgrade spustené – manuálne, z nástroja na správu konfigurácie alebo v časti bezobslužné aktualizácie – tieto pozastavené balíky sa nepresunú. V výstupe aktualizácie ich uvidíte uvedené v časti „pozastavené“ a môžete ich zámerne skontrolovať a zrušiť ich pozastavenie v čase údržby, keď budete pripravení.
Niekoľko pascí. Ľudia držia nvidia-driver-580 a zabudnúť cuda-drivers-580, čo je skutočný metabalík v repozitári CUDA. Ak cuda-drivers-580 aktualizácie, pretože tranzitívna závislosť chce novšie bodové vydanie, stiahne si nové nvidia-dkms-580 s ním a stratili ste PIN kód. Uveďte oba. Ľudia majú obraz jadra, ale nie hlavičkové súbory, jadro sa aj tak aktualizuje kvôli metabalíku a DKMS nedokáže nájsť hlavičkové súbory pri pokuse o obnovu — nvidia-smi Funguje až do reštartu, potom prestane. Vždy držte obrázok a hlavičky pohromade.
Problémy s jadrom a DKMS
DKMS (Dynamic Kernel Module Support) je systém, ktorý obnovuje moduly jadra mimo stromu vždy, keď sa jadro zmení. NVIDIA nvidia-dkms-XXX Balík zaregistruje ovládač ako modul DKMS, takže teoreticky aktualizácia jadra spravovaná pomocou apt spustí čistú obnovu modulu a vy reštartujete systém do funkčného systému.
V praxi zlyhávajú rekonštrukcie DKMS tromi spôsobmi, ktoré sa opakujú:
Pre nové jadro nie sú nainštalované hlavičkové súbory jadra – čo je bežné, keď bol balík jadra nainštalovaný, ale balík hlavičkových súborov bol odfiltrovaný pomocou pripnutia nastavení apt alebo vlastného výberu. Nové jadro sa spustí, chýba modul NVIDIA, nvidia-smi vráti chybu „NVIDIA-SMI zlyhala, pretože sa nepodarilo komunikovať s ovládačom NVIDIA.“
Nové jadro je pre vetvu ovládača príliš nové. R570 sa neskompiluje čisto s najnovším jadrom 6.14; R580 áno. Ak dovolíte, aby vás HWE bump pretlačil na jadro, s ktorým vetva ovládača nebola nikdy testovaná, DKMS vygeneruje chybu zostavenia v /var/lib/dkms/nvidia/.../make.log a reštartujete systém do funkčného, ale bez grafickej karty.
Bezpečné spustenie je povolené a prestavaný modul nie je podpísaný. Canonical ubuntu-driversBalíky inštalované na inštaláciu sú dodávané s riadeným podpisovaním od spoločnosti Canonical. Balíky CUDA-repo od spoločnosti NVIDIA to nerobia; vyžadujú si registráciu kľúča vlastníka počítača (MOK) a podpisovanie prestavaných modulov pri každej zmene jadra. DKMS dokáže podpisovanie vykonať automaticky so správnou konfiguráciou pre každý modul, ale musí sa nastaviť pred prvou prestavbou, nie po tom, čo sa systém nepodarí spustiť. Ak nepotrebujete Secure Boot – a na serveri s bezhlavou inferenciou v uzamknutom racku ho pravdepodobne nepotrebujete – pred inštaláciou ovládača ho vypnite vo firmvéri a preskočte celý tento problém.
Pripnutie jadra obchádza všetky tri kroky. Jadro sa nemení bez vášho pričinenia, hlavičky zostávajú zhodné a prestavaný modul sa naďalej načítava. Keď chcete vziať nové jadro – pre CVE alebo skutočnú funkciu – urobíte to zámerne, so snapshotom, pripraveným na vrátenie späť.
CUDA bez použitia hardvéru — keď (zriedka) je stále správna
L02 tvrdí, že CUDA bez použitia hardvéru je v súčasnosti väčšinou nesprávnou voľbou: kontajnery skrývajú fungovanie verzií CUDA, oddeľujú hostiteľa od pracovnej záťaže a predstavujú zanedbateľné náklady na výkon. To platí pre ~95 % inštalácií.
Výnimky sú úzke. Profilovanie GPU na úrovni jadra pomocou Nsight Systems / Nsight Compute, kde kontajnerová vrstva skrýva systémové volania, na ktorých vám záleží. Práca s ovládačmi – spúšťanie predbežných ovládačov od NVIDIA, ladenie pádov, ktoré zahŕňajú samotný modul jadra. Prostredia s úzkou medzerou, kde je sťahovanie a dôverovanie obrazom OCI ťažšie ako udržiavanie zamrznutého zrkadla apt. Hŕstka HPC stránok, ktoré postavili všetko okolo... module load a MPI bez použitia hardvéru a nemajú záujem o zmenu.
Pre všetkých ostatných: nainštalujte ovládač na holé železo, nechajte hostiteľa čistý od CUDA a spúšťajte CUDA v kontajneroch. nvidia-container-toolkit (zahrnuté v L02) ich čisto premosťuje.
Neobsluhované aktualizácie – čo povoliť a čo blokovať
Ubuntu unattended-upgrades Balík je dobrý a mali by ste ho nechať zapnutý. Úplné vynechanie bezpečnostných aktualizácií na serveri pripojenom k sieti je horšie ako riziko, že automatická aktualizácia sa pokazí. Správny vzorec je: bezpečnostné aktualizácie áno, jadro a balíky NVIDIA nie.
editovať /etc/apt/apt.conf.d/50unattended-upgrades a pridajte do bloku čiernej listiny:
Unattended-Upgrade::Package-Blacklist {
"linux-image-";
"linux-headers-";
"linux-generic";
"linux-modules-";
"nvidia-";
"libnvidia-";
"cuda";
"cuda-";
"libcudnn";
};
apt-mark hold už bráni aktualizácii týchto balíkov. Čierna listina je nemenná – explicitne uvádza zámer, zastavuje unattended-upgrades od zaznamenania čo i len pokusu a prežije neopatrný apt-mark unhold od juniorského administrátora. Spustite obe.
Potvrdiť sledovaním /var/log/unattended-upgrades/unattended-upgrades.log po ďalšom spustení. Mali by ste vidieť, ako sa bezpečnostné balíky prechádzajú a ako sa blokované/zakázané balíky explicitne preskakujú.
Príručka obnovy „Vykonal som aktualizáciu a teraz nič nefunguje“
Niekto bežal apt full-upgrade (alebo to urobil váš nástroj CM) a pri ďalšom reštarte sú grafické karty preč. Poradie operácií:
- Spustenie. Ak sa systém nespustí, podržte kláves Shift / Esc pri zadávaní príkazu GRUB a vyberte predchádzajúce jadro z ponuky spustenia. Potvrďte
nvidia-smifunguje pod starým jadrom. Ak áno, problém je v novom jadre; pripnite staré (apt-mark hold linux-image-<old>) a pokračujte. - Ak sa systém spustil, ale
nvidia-smipíše nesúlad NVML, spúšťate nový používateľský priestor so starým načítaným modulom. Reštartujte. Takmer vždy to opraví. - If
nvidia-smipíše, že ovládač nie je načítaný, skontrolujte/var/lib/dkms/nvidia/<version>/build/make.logadmesg | grep -i nvidiaNajčastejšie chyby: chýbajúce hlavičky jadra (apt install linux-headers-$(uname -r)potomdkms autoinstall); jadro príliš nové pre ovládač (zámerne prejdite na nižšiu verziu jadra alebo aktualizujte vetvu ovládača); Secure Boot odmieta nepodpísaný modul (mokutil --sb-state, potom buď deaktivujte SB, alebo zaregistrujte MOK). - Ak boli samotné balíky ovládačov aktualizované do stavu, ktorý ste nechceli – napríklad metabalík stiahol R585 cez váš pripnutý R580, pretože niekto odstránil blokovanie – vymažte ich a znova nainštalujte:
sudo apt purge '*nvidia*' '*cuda*' && sudo apt autoremove, potom zopakujte inštaláciu z repozitára CUDA vo verzii, ktorú skutočne chcete, a potom znova použite pozastavenia. - Ak máte snímku systému – a mali by ste, pozrite si nižšie – obnovte ju. To znamená dvadsať minút návratu do známeho dobrého stavu oproti štyrom hodinám ladenia.
Snímka systému predtým, ako sa dotknete ovládača alebo jadra
Bez ohľadu na rozloženie úložiska si pred akoukoľvek operáciou s ovládačom alebo jadrom vytvorte snímku. Používatelia ZFS (/ na ZFS alebo samostatnej sade údajov) získajte to zadarmo s zfs snapshot rpool@pre-driver-upgrade-2026-05-15Používatelia LVM s tenkými poolmi môžu lvcreate --snapshotPoužívatelia ext4 bez LVM sú nútení používať úplné zálohy; to je jeden z dôvodov, prečo sa venujeme rozloženiu súborového systému v... L04.
Disciplína, ktorá sa vypláca: nikdy sa nedotýkajte ovládača, balíkov CUDA ani jadra bez toho, aby ste si v priebehu predchádzajúcich piatich minút urobili snímku. Cena za snímku sú sekundy. Cena za to, že ju nemáte, keď sa aktualizácia pokazí, je pol dňa prestoja a niečí večer.
Cesta k aktualizácii LTS
Aktualizácie Ubuntu z LTS na LTS prebiehajú každé dva roky; pre servery s umelou inteligenciou odporúčame vynechať každý druhý rok. Postup je nasledovný:
22.04 ──(skip 23.x interim, skip 24.04 if production-stable)──▶ 26.04
24.04 ──(skip 25.x interim, skip 26.04 if production-stable)──▶ 28.04
Zdôvodnenie: náklady na aktualizáciu LTS na serveri s umelou inteligenciou sú vysoké (opätovné overenie ovládačov, opätovné testovanie obrazu kontajnera, často opätovné spustenie integračných benchmarkov), výhoda jedného kroku namiesto dvoch je malá a nástroje na aktualizáciu z LTS na LTS v Ubuntu plne podporujú toto preskočenie. Naplánujte aktualizáciu, naplánujte si časový úsek údržby, vytvorte snímku, spustite ju. do-release-upgrade, týždeň testovať v prostredí a potom presunúť pracovné zaťaženie späť. Prechod priamo z verzie 22.04 na verziu 26.04 je podporovaný a väčšina zákazníkov Kentina ho nakoniec urobí koncom roka 2026 alebo v roku 2027.
Čomu sa vyhnúť: aktualizáciám na mieste počas vývojového sprintu, aktualizácii bez snapshotu, aktualizácii a následnej dist-upgrade NVIDIA stacku súčasne. Zmeňte jednu vec naraz.
Kontrolný zoznam inštalácie kalenia
Pre novú inštaláciu Ubuntu 24.04 LTS na serveri s umelou inteligenciou postavenom na Kentino:
- Nainštalujte operačný systém. Vyberte ext4 pre
/, Pozri L04 pre dátové vrstvy. - Vypnite funkciu Secure Boot vo firmvéri, pokiaľ nemáte konkrétny dôvod na jej zapnutie.
- Pridajte NVIDIA CUDA
aptúložisko prostredníctvomcuda-keyring. - inštalovať
cuda-drivers-580anvidia-dkms-580iba — niecudameta-balík, čcuda-toolkitna hostiteľovi. - Reštart. Overiť
nvidia-smi. -
apt-mark holdbalíky ovládačov, spustené jadro a hlavičkové súbory jadra. Znova overte pomocouapt-mark showhold. - editovať
/etc/apt/apt.conf.d/50unattended-upgradesna čiernu listinulinux-,nvidia-,libnvidia-,cuda,cuda-,libcudnn. - inštalovať
nvidia-container-toolkit(vidieť L02) a spustitedocker run --rm --gpus alldymový test. - Urobte snímku koreňa označeného
post-install-baseline. - Zdokumentujte verziu ovládača, verziu jadra a verziu CUDA v runbooku racku. Ďalší, kto sa na tento server pozrie o osemnásť mesiacov, bude musieť vedieť, čo bolo zámerné.
Jednoriadková verzia každého odporúčania v tomto článku: zapnúť ovládač, zapnúť jadro, zakázať ich bezobslužné aktualizácie, vytvoriť snímku systému pred zmenou, meniť jednu vec naraz. Približne 80 % tiketov „môj server AI sa stále pokazí“, ktoré vidíme, by neexistovalo, keby sa dodržalo týchto päť pravidiel.
L02 pokrýva zvyšok balíka nad rámec tohto ovládača – CUDA, cuDNN, sadu nástrojov pre kontajnery, obrázky NGC. L04 pokrýva rozloženie úložiska, do ktorého by ste mali umiestniť svoje snímky a súbory údajov. L05 zahŕňa monitorovanie (DCGM, Prometheus), takže keď sa niečo odchýli, zistíte to skôr ako vaši používatelia.
Toto je súčasť Kentino Wiki, referenčnej série o umelej inteligencii, robotike a systémoch, ktoré ich spájajú. Komentáre a opravy sú vítané na info@kentino.com.