Cena za milión tokenov: On-Prem vs. cloud

V roku 2026 existujú tri čestné spôsoby, ako si kúpiť inferenciu LLM: zavolať na hostovaný koncový bod niekoho iného a platiť za token (cloudové LLM API), prenajať si GPU na hodinu a prevádzkovať vlastný model (prenájom cloudového GPU) alebo kúpiť si server a prevádzkovať ho vo vlastnom racku (on-premise). Cena milióna tokenov vyzerá v týchto troch prípadoch dramaticky odlišne a nie v poradí, ako si väčšina kupujúcich myslí.

Tento článok prepočítava v eurách bez DPH. Cieľová skupina: niekto, kto sa rozhoduje, či bude naďalej platiť mesačne za OpenAI, prejsť na hostovaného poskytovateľa s otvoreným modelom, prenajať si H100 alebo kúpiť 4-/8-GPU box. Uvádzame ceny z mája 2026 a končíme päťminútovým procesom rozhodovania. Krížové odkazy: T01 celkové náklady na vlastníctvo na grafickú kartu, W07 výber karty, I04 čísla na stene.

Tri platformy

Rozhranie API cloudového LLM. OpenAI, Anthropic, Google, Together, Fireworks. Platba za každý prijatý a vybratý token. Žiadne náklady na nečinnosť, žiadne kapitálové výdavky, žiadna prevádzka. Taktiež žiadny výber modelu mimo ich katalógu, žiadna LoRA, žiadna kvantitatívna kontrola.

Prenájom cloudového GPU. AWS p5/p5e/p6, Azure ND H200/B200, GCP A3 Ultra a špecializované cloudy (Lambda, CoreWeave, Nebius, RunPod). Prenajmite si inštanciu GPU na hodinu a spúšťajte čokoľvek. Prinášate si model, obslužný stack, operácie. Platíte, či už obslúžite jeden token alebo miliardu za danú hodinu.

On-premise. Kúpte si 4- alebo 8-GPU box. Umiestnite ho do racku, vašu budovu alebo kolos. Prinášate si napájanie, chladenie, sieť, prevádzku. Amortizujte počas troch rokov. Marginálna cena tokenu je elektrina. Fixná cena je všetko, čo ste už zaplatili.

Tri rôzne tvary nákladov – čisto variabilné, čisto fixné s výrazným poklesom, kapitálové výdavky plus marginálne – ktoré sa navzájom vyrovnávajú v rôznych bodoch pozdĺž osi priepustnosti.

Ceny rozhrania Cloud LLM API

USD za milión tokenov, verejné stránky s cenami, máj 2026. EUR za EUR/USD ≈ 1.08.

Poskytovateľ Modelka Vstup $/Mtok Výstup $/Mtok Vstup €/Mtok Produkcia €/Mtok
OpenAI GPT-5 1.25 10.00 1.16 9.26
OpenAI GPT-5 mini 0.25 2.00 0.23 1.85
OpenAI GPT-5 nano 0.05 0.40 0.05 0.37
OpenAI GPT-4.1 / o3 2.00 8.00 1.85 7.41
Antropický Claude Opus 4.7 15.00 75.00 13.89 69.44
Antropický Claude Sonnet 4.6 3.00 15.00 2.78 13.89
Antropický Claude Haiku 4.5 1.00 5.00 0.93 4.63
Google Gemini 2.5 Pro 1.25 10.00 1.16 9.26
Google Gemini 2.5 Flash 0.30 2.50 0.28 2.31
Google Gemini 2.5 Flash-Lite 0.10 0.40 0.09 0.37
spolu Lama 3.3 70B 0.88 0.88 0.81 0.81
spolu Qwen 2.5 72B 1.20 1.20 1.11 1.11
spolu DeepSeek-V3 1.25 1.25 1.16 1.16
spolu Lama 3.1 405B 3.50 3.50 3.24 3.24
AWS Bedrock Lama 3.3 70B 0.72 0.72 0.67 0.67
Blankyt Lama 3.3 70B 0.59 0.79 0.55 0.73

Dva úprimné názory. Uzavreté modely Frontier (Claude Opus 4.7, GPT-5, Gemini 2.5 Pro) sú rádovo drahšie ako hostované API s otvoreným modelom, ktoré obsluhujú Llama 70B alebo DeepSeek-V3 – cena „najinteligentnejšie teraz“ verzus „najlepšie otvorené váhy teraz“. Pre väčšinu produkčných úloh (RAG, kroky agenta, kód, klasifikácia) je Sonnet 4.6 alebo GPT-5 mini prevádzkovým bodom, nie vlajkovou loďou. Výstupné tokeny stoja tri až sedemkrát viac ako vstupné na uzavretých poskytovateľoch a zhruba rovnako na hostiteľoch s otvoreným modelom. Hyperscaler SKU s otvoreným modelom (Bedrock, Azure) účtujú 30 – 80 % prémiu oproti Together alebo Fireworks za rovnaký model – platíte za integráciu IAM a jednu faktúru, nie za lacnejšie tokeny.

Cena za Mtok v rámci lokálnej siete

Cena za Mtok sa rovná celkovým nákladom za tri roky vydeleným počtom tokenov poskytnutých počas troch rokov. Menovateľ závisí od využitia; čitateľ je zhruba fixný.

On-prem €/Mtok =
    (capex + 3y electricity + 3y maintenance + 3y ops) /
    (sustained tok/s × utilization × 3 × 8,760 × 3,600 / 1e6)

Pripojenie celkových nákladov na vlastníctvo pre každú grafickú kartu (GPU) z T01 pri 60 % využití, 0.20 €/kWh, PUE 1.4:

vybudovať 3-ročné celkové náklady na vlastníctvo € Trvalý toxín/y Žetóny/3 roky (Mtok) € / Mtok
4× RTX 5090 (Llama 70B INT4 TP=4) 27,000 1,800 102,000 0.26
4× Pro 6000 BW SE (Llama 70B FP8 DP) 58,000 1,920 109,000 0.53
4× Pro 6000 BW SE (Qwen 32B INT4) 58,000 2,400 136,000 0.43
8× Pro 6000 BW SE (Llama 70B FP8 DP) 115,000 3,800 215,000 0.53
8× L4 (Llama 8B FP8) 36,000 5,200 295,000 0.12

Znížte využitie na 30 % a každé číslo sa zdvojnásobí. Zvýšte na 80 % a 8B na úrovni L4 skončí na 0.09 €/Mtok, čo je lacnejšie ako každé cloudové API pre danú triedu. Matematika klesne pod 25 % využitia, pretože celkové náklady na vlastníctvo (TCO) sú definované predovšetkým kapitálovými nákladmi, ktoré ste zaplatili, bez ohľadu na to, či ste ich využili alebo nie.

Bod zvratu

Prekryte čiaru oblačnosti. Lama 70B na 100 miliónov tokenov/mesiac, vyvážené 50/50, na Together: 100 × 0.81 € = 81 €/mesiac → 2 916 € za tri roky. Oproti 4 × 5090 on-premise s cenou 27 000 € vyhráva Together o 24 000 €. Pri 100 miliónoch tokenov/mesiac je on-premise úplne nesprávny.

Zatlačte na 1 miliarda tokenov/mesiac: 1 000 × 0.81 € = 810 €/mesiac → 29 160 € za tri roky. Spolu a 4 × 5090 sú do 2 000 €. Pri 1.5 miliardy €/mesiac má on-premise podstatné víťazstvo.

Bod zvratu pre Inferencia triedy 70B vs. najlacnejšie API hostované na otvorenom modeli pristane okolo 1.0 – 1.5 miliardy tokenov mesačne udržané na 4× 5090. Pre API s uzavretou hranicou (Claude Sonnet 4.6 za 8.34 €/Mtok zmiešaný, GPT-5 za 5.21 €/Mtok zmiešaný) sa bod zlomu posúva na 80 – 150 miliónov tokenov mesačne — hranica oblačnosti je rádovo strmšia.

Toto je najdôležitejšie číslo v tomto článku: Miera zvratu nie je „100 miliónov tokenov mesačne za všetko“. Je špecifická pre pracovnú záťaž a úplne závisí od toho, s ktorou cloudovou linkou súťažíte. Kupujúci, ktorí hovoria „dosiahli sme 50 miliónov, mali by sme prejsť na lokálnu verziu“, zvyčajne porovnávajú Claude Opus, kde majú pravdu – ignorujú fakt, že presun pracovnej záťaže z Opus na Sonnet 4.6 im ušetrí päťkrát viac ako presun zo Sonnet na lokálnu verziu pri takomto objeme.

Prenájom cloudovej GPU – stredná možnosť

Hodinové sadzby za GPU, máj 2026 na požiadanie:

Poskytovateľ Inštancia GPU $/hod. inštancia $/hodinu GPU
AWS p5.48xveľký 8× H100 SXM 55.18 6.90
AWS p5e.48xlarge 8× H200 SXM 30.00 3.75
AWS p6-b200 8× B200 74.88 9.36
Blankyt ND H200 v5 8× H200 31.00 3.88
GCP a3-ultragpu-8g 8× H200 28.00 3.50
Lambda 8× H100 8× H100 16.00 2.00
CoreWeave 8× H100 8× H100 19.20 2.40

Rezervované 1-ročné commity majú zľavu 25 – 35 %. AWS p5 on-demand je zhruba 3 × Lambda pre rovnaký kremík H100. Prepočítané na token: 8 × H100 pri Lambde s Llama 3.3 70B FP8 pri ~3 500 tokoch/s trvalo → 16 USD/hod × 8 760 × 3 = 389 000 EUR za 3 roky → 1.96 EUR/Mtok pri 60 % využití. To je 4× 8× Pro 6000 SE on-premise build (0.53 €/Mtok) a 2.5× len voláme Spolu (0.81 €/Mtok).

Prenájom H100 na inferenciu otvoreného modelu je to najhoršie z oboch svetov: sadzby za prenájom zariadenia a prevádzku. Matematika funguje iba vtedy, keď potrebujete konkrétny model, ktorý nikto nehosťuje, a chýba vám objem pre on-premise. Prenájom cloudovej GPU má jeden reálny prípad použitia: tréning v nárazovej fázeDoladenie LoRA na 8× H100 počas 8 hodín stojí v Lambde približne 130 dolárov. Žiadne on-premise celkové náklady na vlastníctvo (TCO) to neprekonajú pri jednorazovom použití. Logika sa neprenáša do inferencie, ktorá je trvalá a beží 24 hodín denne, 7 dní v týždni. Pasca „spot“: spot/preemptible/community úrovne ponúkajú zľavu 50 – 80 %, ale sú prerušiteľné. Vhodné pre repliky inferencie bez štátnej príslušnosti. Pri 18-hodinovej tréningovej úlohe, ktorá kontroluje každý krok, dve prerušenia zdvojnásobia vaše náklady na dokončený krok a už nie ste lacnejší ako on-demand.

Skryté náklady nikto neuvádza

cloud: Výstupný poplatok 0.05 – 0.09 USD/GB pri spätnom prenose obrázkov, zvuku alebo videa. Zaznamenávanie údajov pridáva 5 – 10 % vo veľkom meradle. Kontext opätovnej fakturácie je najhoršie – každé API účtuje plnú výzvu pri každom volaní, takže kontext agenta s 50 000 tokenmi stojí 50 000 vstupných tokenov. za krok 20-krokového cyklu. Promptné ukladanie do vyrovnávacej pamäte (Anthropic, OpenAI, Google ho všetky podporujú) znižuje túto hodnotu o 50 – 90 % pri predponách uložených v vyrovnávacej pamäti, ale iba ak na to máte pripravenú architektúru. Limity produkčnej rýchlosti začínajú na 30 000 – 500 000 TPM a vyžadujú históriu používania; noví zákazníci nemôžu spúšťať vo veľkom rozsahu od prvého dňa. SKU v regióne EÚ sú o 10 – 20 % vyššie ako v regióne východ USA s nižšou dostupnosťou.

On-premise: Prevádzkový čas pri 0.1 – 0.3 FTE na server je 8 000 – 24 000 EUR/rok, nie je to v matematike na Mtok. Prestoje si vyžadujú redundantný box alebo elegantný cloudový záložný systém. Elektrina nie je všade 0.20 €/kWh — Priemyselné ceny v EÚ v roku 2026 sa pohybujú od 0.09 €/kWh (vodné elektrárne vo Švédsku, Nórsku) do 0.35 €/kWh (Taliansko, Írsko), v Nemecku na úrovni 0.18 € – 0.22 €/kWh pre dotovaný priemysel, v Česku na úrovni 0.18 € – 0.25 €/kWh pre otvorený komerčný sektor. V prípade Talianska alebo Írska sa každý riadok o elektrine v T01 Cena racku Colo sa zvyšuje o 50 % a je 100 – 300 €/mesiac pre 4U – 3 600 – 10 800 € na tri roky plus hardvér.

Zverejnená cena cloudu je zhruba 1.2 – 1.5-násobok skutočnej faktúry; zverejnené náklady na vlastníctvo pri on-premise sú zhruba 1.2 – 1.5-násobok ceny. Multiplikátory sa pri porovnávaní rušia.

Nenákladové faktory

Pre skutočných kupujúcich sú tri veci dôležitejšie ako cena za Mtok.

Dátová suverenita. Najväčším dôvodom, prečo európski kupujúci v roku 2026 prechádzajú na on-premise riešenia, je GDPR a sektorové pravidlá (DORA, NIS2, AI Act, MDR). Odosielanie produkčných výziev s osobnými údajmi, zdravotnými záznamami alebo priemyselnými tajomstvami do koncového bodu hostovaného v USA je zmluvný problém bez ohľadu na cenu. SKU pre región EÚ neznamenajú, že sú kontrolované EÚ. Pre regulovaného kupujúceho nie je prémiové on-premise riešenie nákladom, ale cenou za legálne povolenie nasadenia.

Latenčná spodná hranica. Spojenie WAN s najbližším hostovaným koncovým bodom pridáva RTT 15 – 40 ms v rámci EÚ a 80 – 120 ms v transatlantickom prostredí. On-premise na 10 GbE LAN je menej ako milisekunda. Pre interaktívny chat je delta WAN neviditeľná oproti 800 ms TTFT. Pre riadiacu slučku robota (I01) alebo hlasového agenta s odozvou menej ako 300 ms, WAN je fatálna.

Prispôsobiteľnosť. Cloudové API poskytujú model a kvantifikáciu, ktorú si poskytovateľ vybral. V lokálnej si vyberiete model, kvantifikáciu, obslužný zásobník (vLLM, SGLang, llama.cpp), adaptéry LoRA a špekulatívny dekodér. Pre výskumné laboratóriá alebo špecializované produkty je to to, čo kupujete – cena za Mtok je druhoradá.

Ak sa nič netýka, kupujúci by mal byť v cloude pod hranicou zvratu. Nie každý potenciálny zákazník by si mal kúpiť server.

Pracovné rozhodnutie: pracovná záťaž triedy 70B v dvoch zväzkoch

Profil zákazníka: SaaS zameraný na klasifikáciu a sumarizáciu dokumentov, vstup/výstup 70/30, model otvorenej váhy triedy 70B.

voľba Pri 100 M tok/mesiac (3 roky) Pri 2 miliardách tok/mesiac (3 roky)
Spolu (Láma 3.3 70B) €2,916 €58,320
AWS Bedrock (Llama 3.3 70B) €2,412 €48,240
Claude Sonnet 4.6 (odkaz na hranice) €21,996 €439,920
On-premise 4× 5090 (amortizované) €27,000 €27,000
Lambda 8× H100 s vlastným hosťovaním €389,000 €389,000

Pri 100 miliónoch tokenov mesačne Bedrock rádovo vyhráva oproti on-premise; zákazník si box nezaslúžil. Pri 2 miliardách tokenov mesačne on-premise jednoznačne vyhráva s rozdielom 1.8 – 2.2×, a to aj oproti najlacnejšej hostovanej alternatíve. Miera zvratu pri tejto pracovnej záťaži sa pohybovala okolo 800 miliónov – 1.2 miliardy tokenov mesačne. Pod touto hodnotou prenájom. Nad touto hodnotou vlastníctvo.

Rozhodovacia matica

Objem / mesiac Model 8B–13B Model 32B Model 70B Hranica (Claude / GPT-5)
< 100 M tok Cloud API Cloud API Cloud API Cloud API
100 – 500 miliónov tokov Cloudové API alebo 4× L4 Cloud API Cloud API Cloud API
500 M – 1 B 4–8× L4 lokálne 4× 5090 alebo Cloud Oblak (Podklad/Spolu) Cloud API
1–5 B tok 8× L4 lokálne 4 × 5090 4× 5090 alebo 4× Pro 6000 SE Cloud + hybridné riešenie on-premise
5–50 B tok 8× klaster L4 4× Pro 6000 BW SE 4–8× Pro 6000 BW SE Frontier cloud + lokálne riešenie pre oddych
> 50 B tokov Viacuzlový L4 8× Pro 6000 BW SE 8× Pro 6000 SE × N Podnikové sadzby + hybridný systém

Konzervatívny – regulovaný kupujúci posunie stĺpec lokálneho predaja o jeden riadok skôr; experimentálny kupujúci o jeden riadok neskôr. Stĺpec Frontier je špeciálny: žiadna lokálna zostava nenahrádza Claude Opus 4.7 ani GPT-5. Sú to kvalitné SKU, ktoré voláte podľa potreby, nie pracovné zaťaženia, ktoré hostujete.

Úprimný pohľad

Väčšina potenciálnych zákazníkov, ktorí prídu s myšlienkou, že potrebujú server, si to nemyslí. Pri typických objemoch – 5 – 50 miliónov tokenov mesačne pre produkt v ranom štádiu, 50 – 500 miliónov pre strednú fázu – cloudové API vyhráva ďalších dvanásť až dvadsaťštyri mesiacov. Správna odpoveď je „používajte Together alebo Bedrock, sledujte svoje mesačné výdavky a zavolajte nám, keď prekročia hranicu 1 500 EUR mesačne.“

Kupujúci, pre ktorých má v roku 2026 zmysel prenájom v rámci firmy, sa delia do troch skupín. regulované: údaje nemôžu opustiť budovu. Udržateľné vo veľkom meradle1 token B+/mesiac na modeli triedy 70B, kde matematika vyhráva 2–3×. Robotika alebo nízka latenciaWAN podlaha narušuje aplikáciu. Približne 30 – 40 % našich potenciálnych zákazníkov zodpovedá jednému z nich. Pre zvyšných 60 – 70 % sú cloudové API v roku 2026 pozoruhodným produktom a mali by ich používať, kým sa matematika nezmení.

Školenie je iná téma. Takmer každá pracovná záťaž v rozsahu K-AI (LoRA, QLoRA, doladenie 7B–32B) je lacnejšia v on-premise ako prenájom cloudovej GPU – zariadenie beží počas behu na 100 %. Výnimkou je hyperscale školenie (úplné predbežné školenie 70B+, RLHF v rozsahu), kde potrebujete 8× H100 s NVLink, ktorý nepredávame (W07 (pozri prečo). Prenajmite si ho, prevádzkujte ho, prineste si závažia domov.

Čo urobiť ďalej

Pred rozhovorom s dodávateľom spustite túto postupnosť:

  1. Zmerajte aktuálny mesačný objem tokenov, rozdelené podľa úrovne modelu. Ak to nedokážete, prístrojovú skúšku vykonajte dva týždne. Bez tohto čísla je každý ďalší krok len odhad.
  2. Projekt šesť mesiacov vopred, konzervatívne — vynásobte 1.5–2. Účty za LLM rastú rýchlejšie ako produkt, pretože kontexty sa rozširujú a agenti pridávajú kroky.
  3. Úprimne identifikujte úrovne. Zlomok vyžadujúci hraničnú kvalitu? Jemný zlomok na Sonnet 4.6 / GPT-5 mini? Jemný zlomok na Llama 3.3 70B? Typické rozdelenie: 5% / 25% / 70%.
  4. Faktúra za cloudové výpočty pri plánovanom objeme podľa úrovne z tabuľky vyššie. To je váš konkurent.
  5. Výpočet lokálne pre box 4× 5090 alebo 4× Pro 6000 SE pri projektovanom objeme s použitím T01.
  6. Ak cloud prekročí lokálnu sieť o menej ako 1.5×, zostaňte v cloude. Prevádzka, prestoje a kapitálové výdavky zjedia tú malú výhru.
  7. Ak cloud prekročí on-premise 2× alebo viac, ide o reálny prípad on-premise. Suverenita, latencia a prispôsobenie sa stávajú rozhodujúcimi faktormi – v tomto rozsahu takmer vždy posilňujú lokálne riešenia.
  8. Ak je regulované alebo viazané na latenciu, preskočte matematiku. Kupujete si online bez ohľadu na to. Veľkosť s T01 a W07.

Následné opatrenia T03 funguje trvalo vs. burst – kedy má hybrid zmysel, ako dimenzovať základnú lokálnu sieť s pretečením cloudu. Krížové odkazy: T01 (celkové náklady na vlastníctvo a tok/s na GPU), W07 (Výber grafickej karty), I04 (matematika elektrických rozvodov na stene, ktorá je základom predpokladu o cene €/kWh).

Jedna veta na zapamätanie: Otázka týkajúca sa ceny za milión tokenov nemá všeobecnú odpoveď – má konkrétnu odpoveď pre vašu pracovnú záťaž, váš objem, úroveň vášho modelu a cenu elektriny vo vašej krajine. Predtým, ako čokoľvek podpíšete, si to prepočítajte.