Tokeny za sekundu na euro: Ekonomika GPU pre inferenciu
Väčšina kupujúcich sa pýta nesprávne. Chcú vedieť, ktorá GPU je „najrýchlejšia“. Správna otázka pre pracovnú záťaž produkčnej inferencie je „ktorá GPU vyprodukuje najviac tokenov na euro vynaložené počas nasledujúcich troch rokov pre model, ktorému v skutočnosti slúžim“. Tieto dve otázky majú odlišné odpovede a rozdiel je dostatočne veľký, že striktné vyťaženie z hrubej rýchlosti bežne stojí zákazníkov Kentina 30 – 60 % ich rozpočtu.
Tento článok funguje s výpočtami. Cieľovou skupinou je niekto, kto určuje veľkosť inferenčného zostavenia, čítal W01 a N03a teraz sa musí rozhodnúť medzi RTX 5090, RTX Pro 6000 Blackwell, L40 alebo L4 – a koľko z nich.
Metrika: prečo tok/s za euro, nie tok/s
Dôležité sú dva výkonnostné režimy a ich spájanie je najčastejšou chybou pri dimenzovaní.
Jednoprúdový tok/s je to, čo vidí jeden používateľ, kým čaká na jednu odpoveď. Je to viazané na šírku pásma pri generovaní tokenov a takmer výlučne funkciou šírky pásma VRAM delenej hmotnosťou modelu (pozri W01). Trvalá priepustnosť tok/s je to, čo server vydáva pre mnohých súbežných používateľov s povoleným nepretržitým dávkovaním. Na hardvéri triedy Blackwell je to viazané na výpočtové náklady, keď počet dávok prekročí 16. Na tom záleží produkcii.
Tieto dva sa na tej istej karte líšia 10–25-krát. Jednostreamová Llama 70B INT4 na RTX Pro 6000 Blackwell dosahuje okolo 32 tokov/s. Tá istá karta v dávke 32 s kontinuálnym dávkovaním vLLM dosahuje celkovo viac ako 600 tokov/s. Vyberanie si jednostreamových nasadení s nízkou priepustnosťou rádovo zvyšuje priepustnosť; vyberanie si nasadení s nadmernou priepustnosťou citlivých na latenciu. Matematika celkových nákladov na vlastníctvo tu používa trvalú priepustnosť, pretože tá je to, čo dominuje.
Aktuálne maloobchodné ceny v EÚ (máj 2026)
Nižšie uvedené ceny sú maloobchodné ceny v EÚ bez DPH na otvorenom kanáli – nejde o objemové zmluvy OEM ani o prenájom cloudu. Zdroj: sledovače cien a zoznam distribútorov v EÚ v máji 2026. Považujte ich za rozpätia; štvrťročné výkyvy 10 – 20 % sú bežné.
| GPU | VRAM | TDP | Maloobchodná cena v EÚ bez DPH |
|---|---|---|---|
| RTX 5090 | 32 CZ GDDR7 | 575 W | 2,500 – 3,000 EUR |
| Pracovná stanica RTX Pro 6000 Blackwell | 96 GB ECC | 600 W | 8,000 – 9,500 EUR |
| RTX Pro 6000 Blackwell Server Edition | 96 GB ECC | 600 W | 8,500 – 10,000 EUR |
| L40 | 48 GB ECC | 300 W | 7,500 – 9,500 EUR |
| L4 | 24 GB | 72 W | 2,500 – 3,500 EUR |
| H100 SXM (referenčný, nepredáva ho spoločnosť Kentino) | 80 GB HBM3 | 700 W | 27,000 – 35,000 EUR |
Dve postrehy z tejto tabuľky. Pro 6000 Server Edition stojí zhruba 3-krát viac ako 5090 za 3-krát väčšiu pamäť VRAM a ekvivalentnú šírku pásma – cena sa zameriava na kapacitu pamäte, nie na hrubú rýchlosť. L4 je jediná karta s výkonom pod 100 W. Už len táto skutočnosť mení celkových nákladov na vlastníctvo, keď do rovnice vstúpi elektrina.
Čísla benchmarkov pre jeden GPU
Čísla uvedené nižšie pochádzajú z verejných benchmarkov (vLLM, llama.cpp, SGLang) zozbieraných zo Spheronu, CloudRiftu, RunPodu a vlastných publikovaných behov projektu vLLM od mája 2025 do mája 2026. Nejde o Kentinove benchmarky – porovnali sme ich s našimi internými boxmi 4×5090 a 4×Pro 6000 pre bunky, ktoré pravidelne obsluhujeme; verejné čísla sa pohybujú v rozmedzí ±15 %.
Llama 3.3 70B FP8 — dekódovanie jedného prúdu
| GPU | tok/y | Poznámky |
|---|---|---|
| RTX 5090 | n / a | Závažia FP8 s kapacitou 75 GB sa nehodia na 32 GB |
| Pracovná stanica RTX Pro 6000 BW | 28-34 | Zmestí sa na jednu kartu s KV rezervou |
| RTX Pro 6000 BW Server Ed. | 28-34 | Rovnaký kremík, serverové chladiče |
| L40 | n / a | 48 GB je príliš málo pre FP8 70B; iba INT4 |
| L4 | n / a | Mimo triedy |
| H100 SXM (referencia) | 55-65 | Šírka pásma HBM3 |
Llama 3.3 70B INT4 (AWQ) – dekódovanie jedného prúdu
| GPU | tok/y | Poznámky |
|---|---|---|
| RTX 5090 | n/a jeden | 40 GB INT4 prepúšťa 32 GB; potrebuje 2× |
| 2× RTX 5090 (TP=2) | 24-30 | Viditeľná daň PCIe TP |
| RTX Pro 6000 BW | 30-36 | Pohodlne sa zmestí, viac ako 50 GB voľného miesta pre KV |
| L40 | 14-18 | GDDR6 ECC, nižšia šírka pásma |
| L4 | 4-6 | 24 GB ledva udrží váhu, pomalé |
Qwen 2.5 32B INT4 (AWQ) — jednoprúdový
| GPU | tok/y | Poznámky |
|---|---|---|
| RTX 5090 | 55-65 | Váhy 18–20 GB, KV v zostávajúcich 12 GB |
| RTX Pro 6000 BW | 55-65 | Viazaná šírka pásma s 5090; dostatok priestoru na váhe |
| L40 | 28-34 | Obmedzená šírka pásma |
| L4 | 9-12 | Obmedzená pamäť, obmedzená priepustnosť |
Llama 3 8B FP16 – jednoprúdový a agregovaný
| GPU | Jeden tok/y | Agregát v dávke 32 |
|---|---|---|
| RTX 5090 | 90-110 | 3,200-3,800 |
| RTX Pro 6000 BW | 90-110 | 3,400-4,000 |
| L40 | 45-55 | 1,400-1,800 |
| L4 | 20-28 | 380-550 |
Zopár úprimných postrehov z týchto tabuliek. 5090 a Pro 6000 Blackwell majú rovnakú šírku pásma (1.79 TB/s) a rovnaké dekódovacie rýchlosti na token. — rozdiely sú v kapacite VRAM a ECC, nie v rýchlosti. L40 má v porovnaní s dvojicou Blackwell zhruba polovičnú rýchlosť, pretože GDDR6 ECC je 860 GB/s oproti 1 790 GB/s. L4 je karta so štvrťpásmovou šírkou pásma; vynahrádza to hustotou a cenou.
Pre prácu s jedným streamom triedy 70B je Pro 6000 Blackwell jedinou kartou, ktorá spúšťa model na FP8 v jednom slote. 5090 vás núti používať INT4 a 2-way tensor paralelne – a TP=2 na PCIe stráca 30 – 35 % kvôli all-reduce (pozri N03).
Škálovanie viacerých GPU: daň z PCIe
Tenzorový paralelný pripojení iba k PCIe sa neškáluje lineárne. Mechanizmus sme rozobrali v N03Tu sú empirické multiplikátory, ktoré by ste mali dosadiť do modelu celkových nákladov na vlastníctvo.
| GPU | konfigurácia | Realistické škálovanie priepustnosti vs. 1× |
|---|---|---|
| 1 × | základné | 1.00 |
| 2 × | TP=2 PCIe Gen5 | 1.50-1.70 |
| 4 × | TP=4 PCIe Gen5 | 2.5-3.0 |
| 8 × | TP=4 × PP=2 (preferované) | 5.0-6.0 |
| 8 × | TP=8 PCIe (vyhnúť sa) | 4.0-4.8 |
Paralelné cesty kanála a dát sa škálujú takmer lineárne; tenzorovo paralelné cesty platia daň, ktorá rastie s počtom GPU. Pre model triedy 70B je správna konfigurácia na 8× 5090 dve nezávislé repliky (DP=2 × TP=4) alebo TP=4 × PP=2 – nie TP=8. Pozri K03 pre konfiguračné pravidlá.
Toto je dôležité z hľadiska nákladov, pretože zdvojnásobenie počtu grafických procesorov nikdy nezdvojnásobí priepustnosť. Naivná rozpočtová prognóza typu „dvakrát viac grafických procesorov, dvakrát viac prenosov“ nadhodnocuje sľuby o 30 – 50 %.
Model 3-ročných celkových nákladov na vlastníctvo (TCO)
Cena grafickej karty je zhruba polovičná oproti skutočným nákladom na prevádzku inferenčnej karty počas troch rokov. Druhá polovica je elektrina, podiel na šasi a podlahová plocha. Nižšie uvedený model je to, čo interne používame na dimenzovanie K-AI.
Per-GPU 3-year TCO =
GPU cost
+ Chassis share (chassis + CPU + RAM + PSU + NIC) / GPU count
+ Electricity: TDP × utilization × 8,760 h × 3 × €0.20/kWh
+ Colo/rack space share
+ Maintenance & spares (~5% of GPU cost / year)
Predpoklady použité nižšie:
- elektrina: 0.20 €/kWh zmiešaná (typická priemyselná kolonia EÚ alebo vlastnená DC). Český maloobchod je často 0.18 € – 0.22 €; Nemecko je to vyššia cena.
- využitie: 60 % trvalo (realistické výrobné zaťaženie – nie referenčná hodnota 100 %, nie laboratórna hodnota 5 %).
- PUE: 1.4. Réžia dátového centra (chladenie, straty v distribúcii). To zvyšuje efektívnu spotrebu elektriny z grafického procesora na 0.28 €/kWh.
- Podiel podvozku: 4 000 EUR amortizovaných na 4 GPU (1 000 EUR/GPU) pre zostavu Kentino 5090 so 4 GPU; 8 000 EUR na 8 (1 000 EUR/GPU) pre šasi Pro 6000 s 8 GPU.
- údržba: 5 %/rok nákladov na GPU (fond na náhradnú kartu + čas ovládača/prevádzky).
Tabuľka celkových nákladov na vlastníctvo (TCO) pre jednotlivé grafické procesory
| GPU | Karta € | Podvozok € | Elektrina € (3 roky) | Údržba € (3 roky) | Celkové náklady na vlastníctvo 3 roky € |
|---|---|---|---|---|---|
| RTX 5090 | 2,800 | 1,000 | 2,540 | 420 | 6,760 |
| RTX Pro 6000 BW WS | 8,800 | 1,000 | 2,650 | 1,320 | 13,770 |
| RTX Pro 6000 BW SE | 9,400 | 1,000 | 2,650 | 1,410 | 14,460 |
| L40 | 8,500 | 1,000 | 1,325 | 1,275 | 12,100 |
| L4 | 3,000 | 800 | 318 | 450 | 4,568 |
| H100 SXM (ref.) | 30,000 | 3,500 | 3,090 | 4,500 | 41,090 |
Riadky elektriny: TDP × 0.60 × 8 760 × 3 × 0.20 × 1.4 (PUE) / 1 000. Linka L4 je pozoruhodná – jej trvalý 3-ročný účet za elektrinu je 318 €. Model 5090 je 2 540 €. Osemnásobok spotreby energie, osemnásobok účtu.
Cena za milión tokenov
Teraz skombinujte celkové náklady na vlastníctvo (TCO) s nameranou trvalou priepustnosťou pri reprezentatívnom zaťažení – Llama 3.3 70B INT4 v dávke 32 alebo Qwen 32B v dávke 32 alebo Llama 8B v dávke 64. Vezmite trvalý tok/s karty, vynásobte ho využitím 0.60 × 3 × 8 760 × 3 600, aby ste získali celkový počet obslúžených tokenov, a vydeľte TCO týmto počtom. Čísla nižšie sú ilustračné; prispôsobte ich vášmu skutočnému modelu a dávke.
| GPU | Pracovná záťaž | Trvalý toxín/y | Žetóny/3 roky (B) | € / Mtok |
|---|---|---|---|---|
| RTX 5090 | Lama 8B FP16 šarža 64 | 3,500 | 199 | 0.034 |
| RTX 5090 | Qwen 32B INT4 šarža 32 | 600 | 34 | 0.20 |
| Pro 6000 BW | Lama 70B FP8 šarža 32 | 480 | 27 | 0.51 |
| Pro 6000 BW | Qwen 32B INT4 šarža 32 | 650 | 37 | 0.37 |
| L40 | Lama 8B FP16 šarža 64 | 1,600 | 91 | 0.13 |
| L40 | Qwen 32B INT4 šarža 32 | 320 | 18 | 0.67 |
| L4 | Lama 8B FP16 šarža 64 | 450 | 26 | 0.18 |
| L4 | Lama 8B FP8 šarža 128 | 650 | 37 | 0.12 |
Tretí stĺpec si prečítajte ako náklady na milión poskytnutých tokenov pri plnej záťaži. API pre otvorené smerovače a cloudové rozhrania pre rovnaké modely si účtujú 0.10 € – 2.00 € za milión tokenov v závislosti od úrovne; to pri trvalej záťaži zaraďuje lokálne riešenia na rovnakú úroveň alebo ich znižuje. Matematika sa rozpadá pod 30 % využitím – celkové náklady na vlastníctvo sú definované predovšetkým kapitálovými výdavkami, za ktoré ste zaplatili, bez ohľadu na to, či ste ich využili alebo nie.
Prípad z roku 5090
Na papieri má 5090 najlepší hrubý tok/s na euro zo všetkých kariet v rade Kentino pre inferenciu pod 72B. 2 800 € za šírku pásma 1.79 TB/s a 32 GB GDDR7 je veľa karty. Pre jedného používateľa modelu triedy 32B nie je nič iné v takomto pomere.
5090 sa rozpadá na dvoch miestach:
- Modely, ktoré sa nezmestia do 32 GB v požadovanom množstve. 70B FP8 (~75 GB) potrebuje 3–4 karty; 70B INT4 (~40 GB) potrebuje 2. Po tenzorovom paralelnom zapojení cez PCIe zaplatíte 30–50 % zníženú daň a vaše tok/s na kartu sa zrútia.
- Škálovanie viacerých GPU nad rámec paralelného spracovania pipeline. 8× 5090 je skutočný produkt (vyrábame ho), ale priepustnosť na kartu na tenzorovo paralelnom 70B je zhruba 0.55× vyššia ako priepustnosť jednej karty. Kúpili ste osem kariet a dostali ste 4.4× vyššiu priepustnosť. Nie 8×.
Silnou stránkou modelu 5090 je hosťovanie viacerých replík menších modelov. 4× 5090 so štyrmi nezávislými replikami Qwen 32B za vyrovnávačom záťaže prekonáva 4× 5090 s tenzorovo paralelným radením a jedným Llama 70B v priepustnosti aj latencii – a úplne sa vyhýba penalizácii PCIe.
Puzdro Pro 6000 Blackwell
96 GB pamäte ECC GDDR7 s prenosovou rýchlosťou 1.79 TB/s je to, čo si kúpite, keď sa na jednu kartu musí zmestiť 70B FP8 a nechcete sa o tom hádať s PCIe. Edície Workstation a Server majú rovnaký kremík, rovnakú pamäť, rovnakú šírku pásma – rozdiel je vo formáte (aktívne vs. pasívne chladenie), systéme BIOS s maximálnym výkonom a validácii pre OEM serverové šasi. Edícia Server stojí o 700 – 1 500 EUR viac a je tou správnou voľbou pre akúkoľvek rackovú zostavu, ktorá beží 24 hodín denne, 7 dní v týždni.
Kde Pro 6000 vyhráva v pomere tok/s na euro:
- Hosting 70B FP8 s jednou kartou. Žiadna tenzorová paralelnosť, žiadne zdanenie PCIe. Jeden stream s rýchlosťou viac ako 30 tok/s, dávkový agregát s rýchlosťou viac ako 480 tok/s.
- Škálovanie prostredníctvom replík. 4× Pro 6000 = štyri nezávislé 70B repliky za routerom. Lineárne škálovanie priepustnosti, elegantná izolácia zlyhaní.
- ECC pre školenia. Ak pracovná záťaž zahŕňa doladenie LoRA / QLoRA alebo úplné preškolenie, ECC si svoje miesto zaslúži (pozri W01).
Kde je Pro 6000 prehnaná: akékoľvek nasadenie, ktoré nevyžaduje >32 GB na kartu. Ak sa všetky vaše modely zmestia na 5090, platíte 3-násobok ceny za VRAM, ktorú nebudete používať. Toto vidíme pravidelne – kupujúci si vyberie Pro 6000, pretože je to „profesionálna“ karta, a potom na nej spustí 13B model.
Prípad L40
L40 sa nachádza v nepríjemnej pozícii. 48 GB ECC, GDDR6 nie GDDR7, šírka pásma 860 GB/s – zhruba polovica Pro 6000 Blackwell pri 75 – 90 % ceny. Pri čistých tok/s na euro pri 75 – 90 % vyhráva Pro 6000.
Puzdro L40 je postavené na troch ďalších osiach:
- TDP. 300 W oproti 600 W. Polovica elektriny za tri roky (1 325 € oproti 2 650 € v našom modeli). V tepelne obmedzenom racku alebo jednofázových obvodoch je to rozdiel medzi štyrmi alebo dvoma kartami.
- Validácia dátového centra. L40 sa dodáva s pasívnym chladením, validáciou OEM pre spoločnosti Supermicro/Dell/HPE a štandardnou 5-ročnou zárukou pre dátové centrá. Pracovná stanica Pro 6000 nie je validovaná pre nepretržitú prevádzku šasi; edícia Server áno, ale je novšia v distribučnom kanáli.
- Strop spoľahlivosti. L40 je určený na trvalé zaťaženie servera. Priemerný čas medzi poruchami pri nepretržitej inferenčnej záťaži je merateľne lepší ako u 5090 odvodeného od spotrebiteľa.
Úprimné znenie: ak vášmu zákazníkovi záleží viac na dostupnosti ako na surových tokoch/och – regulované odvetvia, zmluvy SLA na pohotovosť, čokoľvek, čo stráca peniaze, keď karta uprostred noci vypadne – L40 stojí za stratu v tokoch/och na euro. Pokiaľ ide o surový pomer ceny a výkonu, nie je to tak.
Prípad L4
L4 je ten, na ktorý sa nikto nepýta a ktorý by si mala kúpiť väčšina zákazníkov. 24 GB, 72 W, jeden slot, nevyžaduje napájací konektor, pasívne chladenie. Osem sa ich zmestí do 1U servera. Šestnásť sa zmestí do 2U.
V čom je L4 dobrý:
- Model triedy 8B slúžiaci vo veľkom meradle. Llama 3 8B FP8 v dávke 64 dosahuje okolo 650 tokov/s na kartu. Osem L4 v jednom šasi = spolu 5 000 tokov/s pre koncový bod Llama 8B. To isté šasi ťahá 600 W GPU.
- Hustota viacerých replikácií. Každá L4 hostí nezávislý 8B model. Osem replík za vyrovnávačom záťaže bez akejkoľvek komunikácie medzi GPU. Výpadok jednej karty odoberie 1/8 kapacity, nie celú službu.
- Lokality s obmedzeným výkonom. 16 A obvod dokáže napájať dvanásť L4 plus réžiu hostiteľa. Ten istý obvod sotva dokáže napájať tri 5090.
- Cena za milión tokenov. Pri cene 0.12 €/Mtok za 8B FP8 je L4 lacnejšie ako akékoľvek cloudové API pre rovnakú modelovú triedu.
Čo L4 robí zle: čokoľvek nad 13B, čokoľvek, čo vyžaduje skutočnú šírku pásma, tréning akéhokoľvek druhu. L4 je inferenčná karta s pevnou funkciou pre malé až stredné modely. Ak vaša pracovná záťaž tomu nezodpovedá, vynechajte ju.
Úprimné porovnanie oproti cloudu
Cloudová matematika pre porovnateľnú zostavu. AWS p5.48xlarge (8× H100 SXM) má cenu 98.32 USD/hodinu na požiadanie, normalizovanú na 12.29 USD za hodinu GPU. Špecializované cloudy s umelou inteligenciou (Lambda, RunPod, CoreWeave) stoja 2.00 – 4.00 USD za hodinu H100 na požiadanie a menej pri ročných záväzkoch.
Trojročné náklady na cloud na požiadanie pre jeden inferenčný slot ekvivalentný H100:
- AWS na požiadanie: 12.29 USD × 8 760 × 3 = $323,000
- Spotová/zľavnená AI cloudová ponuka: 2.50 USD × 8 760 × 3 = $65,700
- 1-ročná rezervácia cloudu s umelou inteligenciou: ~1.80 USD × 8 760 × 3 = $47,300
Kentino on-premise 8× Pro 6000 Server Edition: Celkové náklady ~115 000 € za tri roky pre osem kariet. 14 400 € na kartu. To je zhruba štvrtina najlacnejšieho cloudového H100 je rezervovaná pre priepustnosť porovnateľnú s inferenciou (Pro 6000 BW dosahuje ~60–70 % H100 SXM pri inferenčných pracovných zaťaženiach nezávislých od NVLink).
Miera zvratu verzus rezervovaný H100 pre AI cloud: Lokálny server 8× Pro 6000 sa zaplatí pri približne 50 % trvalom využití počas troch rokov. Pod touto hranicou nájomné. Nad touto hranicou vlastníctvo. Toto je rovnaká matematika, ku ktorej dospeje každý seriózny kupujúci nehnuteľností v on-premise, a dôvod, prečo inferencia o on-premise nie je mŕtva ani v roku 2026 napriek zníženiu nákladov na cloud.
Matica odporúčaní pre pracovnú záťaž a GPU
| Pracovná záťaž | Grafická karta prvej voľby | Prečo |
|---|---|---|
| Lama 8B / Qwen 7B / Mistral 7B v mierke | L4 (viacero) | Najlepší tok/s/€ na malých modeloch, najnižší výkon |
| Jeden používateľ, trieda 32B, citlivé na latenciu | RTX 5090 | Najlepšia šírka pásma/€, hodí sa na INT4 |
| Viacpoužívateľská trieda 32B, citlivá na priepustnosť | 2× RTX 5090 alebo 1× Pro 6000 | Replika váhy alebo jedna karta, ak to rozpočet dovolí |
| 70B inferencia, jeden používateľ, kvalita FP8 | RTX Pro 6000 Blackwell | Jediná karta, ktorá pasuje na 70B FP8 v jednom slote |
| 70B inferencia, viacero používateľov, priepustnosť | 4× Pro 6000 BW (repliky DP) | Lineárne škálovanie bez dane z PCIe TP |
| Jemné doladenie 70B (LoRA / QLoRA) | RTX Pro 6000 Blackwell SE | ECC, validácia 24/7, kompatibilné s tréningovým KV v 96 GB |
| 70B tréning od nuly | nie zostava Kentina | Prenajmite si NVLink H100/B200 a potom si prineste závažia na miesto |
| Zmiešaná inferencia + ľahké trénovanie, regulované miesto | L40 | ECC, trvalá spoľahlivosť, overené dátové centrum |
| Obmedzený rozpočet na napájanie racku, hustota 1U | L4 (8× na 1U) | 72 W jednoslotový, ECC nie je potrebný na inferenciu |
| 405B hustá inferencia | 3× Pro 6000 BW (PP) | Jediná cesta na hardvéri Kentino; pozri K03 |
Úprimný pohľad
Väčšina zákazníkov Kentina sa pýta, ktorá karta je najrýchlejšia. Vzhľadom na pracovnú záťaž, ktorú väčšina z nich v skutočnosti má – 7B alebo 8B chatovací model, možno 32B model s uvažovaním, možno model s videním v triede 7B – 13B – je správna odpoveď L4 alebo 5090, nie vlajková loď. Cenová prémia za Pro 6000 Blackwell je pri našich cenách 5 000 – 7 000 EUR za kartu. Pri štyroch kartách na zostavenie to predstavuje 20 000 – 28 000 EUR VRAM, za ktorú zákazník platí a nepoužíva.
Úlohou je opýtať sa, ktoré modely, pri akej súbežnosti, v akom kontextovom okne – a podľa toho ich nadimenzovať. Menšie riešenie, zákazník sa vráti, keď sa prispôsobí škálovaniu.
Čo urobiť ďalej
Ak určujete veľkosť stavby, postupujte podľa týchto krokov v tomto poradí:
- Uveďte všetky modely, ktoré potrebujete obsluhovať, s kvantizáciou a kontextom. Zapíšte si ich. Llama 3.3 70B INT4 @ 8K. Qwen 32B INT4 @ 32K. Llama 8B FP8 @ 16K. Bez tohto zoznamu je každý nasledujúci krok len hádanie.
- Vypočítajte najväčšiu pamäťovú stopu VRAM pre jednu inštanciu (váhy + KV pri cieľovej súbežnosti). Toto je vaša spodná hranica VRAM na kartu.
- Vypočítajte cieľovú hodnotu trvalého tok/s. Súbežní používatelia × tokeny za sekundu na používateľa × pracovný cyklus. Toto určuje počet kariet.
- Mapovanie na GPU. Ak je pamäť < 32 GB → 5090 alebo L4. Ak < 48 GB → L40 alebo 5090 multi-card. Ak 48–96 GB → Pro 6000 Blackwell. Ak > 96 GB → multi-card PP, nie TP.
- Vypočítajte 3-ročné celkové náklady na vlastníctvo (TCO) pri vašom skutočnom využití. Ak je váš pracovný cyklus < 30 %, prehodnoťte cloud. Ak je > 50 %, lokálne riešenia jednoznačne vyhrávajú.
- Pridajte 30% maržu bez ohľadu na to, aký počet GPU hovorí matematika. Skutočné pracovné zaťaženie rastie, veľkosti modelov rastú, podhodnotenia vyrovnávacej pamäte KV sú univerzálne.
Následné články v tejto sekcii sa zaoberajú rovnakými číslami z rôznych uhlov pohľadu: cena na milión tokenov s rozdelením na on-premise verzus cloud (T02) a inferenčná ekonómia založená na princípe trvalého verzus výbuchu (T03). Nadácia pre výber GPU sídli v W07a možnosti paralelizmu, ktoré formujú celkové náklady na vlastníctvo viacerých GPU, sú v K03.
Jediná veta, ktorú si treba zapamätať: Väčšina zákazníkov sa pýta, ktorý je najrýchlejší, pričom by sa mali opýtať, ktorý je pri mojom pracovnom vyťažení najlacnejší. Najrýchlejšia karta je zriedkakedy najlacnejšie riešenie.
Toto je súčasť Kentino Wiki, referenčnej série o umelej inteligencii, robotike a systémoch, ktoré ich spájajú. Komentáre a opravy sú vítané na info@kentino.com.