Výpočty na zariadení vs. mimo zariadenia pre roboty
zdieľam
Každá úloha na robote sa nachádza na jednom z dvoch miest: na doske, napájaná batériou a ventilátormi na hrudi, alebo mimo dosky, na serveri napájanom zo siete, ktorý je vzdialený jeden LAN hop. Ťažká otázka nie je... či potrebujete oboje – takmer vždy potrebujete – ale ktorá pracovná záťaž kam ide a prečo. R08 argumentuje, že vôbec existuje vyhradená okrajová vrstva. Tento článok je rozhodnutím pre jednotlivé pracovné zaťaženia: riadenie motora tu, VLM tam, STT závisí atď.
Rámec je tvrdohlavý. Na každú pracovnú záťaž existuje správna odpoveď a správna odpoveď sa mení, keď sa integrovaný kremík vymkne. Povieme, akým smerom sa každý kus uberá v rokoch 2026 – 2027.
Dva rozpočty, ktoré rozhodujú o všetkom
Pracovná záťaž môže bežať na palube vtedy a len vtedy, ak sa zmestí do dvoch rozpočtov súčasne: energie a PamäťLatencia je tretím obmedzením, ale latencia vám zvyčajne prezradí ktorým smerom tlačiť pracovná záťaž, ktorá vyhovuje, nie to, či vôbec vyhovuje.
Rozpočet energie na humanoida. Humanoid s hmotnosťou 30 – 50 kg nesie batériu s kapacitou 700 – 900 Wh. Dlhodobá chôdza odoberá z aktuátorov 200 – 500 W, pričom počas dynamického pohybu dosahuje maximálnu hodnotu 800 W a viac. Státie v pokoji a premýšľanie odoberá z aktuátorov 80 – 150 W (udržiavací krútiaci moment je nízky, udržiavanie polohy stojí). Zostáva teda približne 60 – 120 W pre... všetko ostatné — výpočty, senzory, chladiace ventilátory, rádio — ak chcete použiteľný dvojhodinový prevádzkový čas. Výpočtový rozpočet v rámci tohto objemu je 30 – 80 W trvalo. Neustále používanie Jetsonu na MAX_N (60 W) skracuje prevádzkový čas robota na polovicu. Toto je nespochybniteľná fyzika, nie konštrukčná voľba.
Pamäťový rozpočet. Jetson AGX Orin 64 GB je 64 GB LPDDR5 zdieľané medzi CPU a GPUOdpočítajte OS (4–6 GB), ROS 2 a SDK výrobcu (2–4 GB), vyrovnávacie pamäte vnímania (2–4 GB pre stereo hĺbku a bodové mračná) a akýkoľvek aplikačný kód. Realistický rozpočet využiteľný pre LLM/VLM je 40–48 GB. Na module Jetson Thor 128 GB sa strop zvýši na ~96 GB použiteľných. Na Orin NX 16 GB sa zníži na ~8–10 GB použiteľných – dosť pre jeden malý model.
Mimochodom, oba rozpočty predstavujú odlišné problémy. K-AI 96 (4× RTX 5090) má 128 GB vyhradenej VRAM a 1.0–1.5 kW výkonu GPU pri zapojení do siete. K-AI 256 (8× RTX 5090) zdvojnásobuje oboje. Výkon a pamäť jednoducho prestávajú byť obmedzením – namiesto toho ich vymeníte za kapitálové výdavky, vykurovanie, vetranie a klimatizáciu a káblové pripojenie.
Vstavaný kremík, realita roku 2026
Palubné možnosti, ktoré sa dnes skutočne dodávajú v serióznych humanoidoch a štvornožcoch:
| SoC | INT8 TOPS (riedke) | Použiteľná pamäť | Napájacia obálka | Čo dokáže spustiť |
|---|---|---|---|---|
| Jetson Orin NX 16 GB | 100 | ~10 GB zdieľaných | 10 – 25 W | YOLO, malý VLM 3B Q4, budíkové slovo |
| Jetson AGX Orin 64 GB | 275 | ~40 GB zdieľaných | 15 – 60 W | YOLO, VLM 7B Q4 za použiteľné sadzby, 13B LLM |
| Jetson AGX Thor 128 GB (2026) | 2070 FP4 TFLOPS | ~96 GB zdieľaných | 40 – 130 W | VLM 32B Q4 s dostatkom priestoru, vnímanie duálneho prúdu |
| Snapdragon 8 Gen 3 / trieda QRB | 45-75 | Zdieľaných ~6–10 GB | 5 – 15 W | Hlasový, budíkový, svetelný životopis |
| Hailo-8 (doplnok M.2) | 26 INT8 VRCH | 2–4 GB na čipe | Typický výkon 2.5 W | Odľahčenie vizuálneho kanála, MobileNet/YOLO |
| Hailo-15 (SoC Vision) | 20 TOPS | Obyvateľ potrubia | 2 – 5 W | Vždy zapnutý životopis s viacerými kamerami |
| Koprocesor Intel N97 / i7-1370P | neuvedené (CPU + iGPU) | Hostiteľ DDR5 | 6 – 45 W | Orchestrácia na vysokej úrovni, ROS 2, lepidlo |
Thor je skoková zmena, nie iterácia. Pamäťový strop 128 GB a tenzorové jadrá Blackwell natívne pre FP4 posúvajú hranicu integrovaných procesorov z „7B VLM, bolestivo“ na „32B VLM, užitočne“ v priebehu jednej generácie. Pracovné zaťaženia, ktoré boli v roku 2025 štrukturálne mimo hry – stredne veľké VLM, kontinuálne titulkovanie scén, stredne veľké plánovače LLM – sa stávajú... kandidáti na palube v roku 2026, ak tepelné riešenie robota dokáže udržať výkon 100 – 130 W.
Hailo a špecializovaná trieda NPU nie sú akcelerátory LLM. Ide o odľahčenie vizuálneho kanála: hlavný Jetson nechajte voľný pre väčší model, spustite vždy zapnutú CV kamery (detekcia objektov, sledovanie, základný VLM-lite) na 3 W čipe.
Trieda Snapdragon QRB je riešením pre roboty zamerané predovšetkým na hlas – prebudenie slovami, tvarovanie lúča, STT – kde je Jetson prehnaný a Cortex-M poddimenzovaný. Užitočný, úzky, čoraz bežnejší.
Mimo paluby: úroveň K-AI ako referencia
Cieľom mimo dosky, na ktorý sa táto séria odvoláva, je rad K-AI – napájaný zo steny, 4U alebo 5U rack, 4 alebo 8 GPU na EPYC alebo Xeon, na 10 GbE prepínači jeden skok od robota. Tri úrovne, ktoré sú dôležité pre robotiku:
| Stupeň | GPU | Agregovaná VRAM | Trvalý výkon | Najväčší realistický VLM (INT4) |
|---|---|---|---|---|
| K-AI 64 / 96 (4 GPU) | 4× RTX 5090 alebo 4× Pro 6000 | 128 - 384 GB | 1.8–2.4 kW | 72B s miestom pre vyrovnávaciu pamäť KV |
| K-AI 128 (4× Pro 6000 Blackwell) | 4× RTX Pro 6000 96 GB | 384 GB | 2.0–2.6 kW | 72B s plným kontextom |
| K-AI 256 (8 grafických kariet) | 8× RTX 5090 alebo 8× Pro 6000 | 256 - 768 GB | 3.5–4.5 kW | 70B + 32B + 7B súčasne |
Rozhodovacia matica
Každé robotické zaťaženie sa dá jasne rozdeliť do jednej z piatich kategórií: vždy na palube, preferované na palube, buď, uprednostňované mimo paluby, iba mimo palubyDôvodom každého umiestnenia je záväzný rozpočet – výkon, pamäť alebo latencia.
| Pracovná záťaž | Umiestnenie | Väzbové obmedzenie | Prečo |
|---|---|---|---|
| Riadiaca slučka motora (500 Hz – 1 kHz) | Vždy na palube | Latencia (< 1 ms) | Sieťový skok je 100 – 10 000-násobok rozpočtu slučky. Bez výnimiek. |
| Bezpečnostné reflexy kĺbov / núdzové zastavenie | Vždy na palube | Latencia (< 5 ms) | Z rovnakého dôvodu; musí fungovať aj vtedy, keď je LAN nefunkčná. |
| Fúzia senzorov IMU | Vždy na palube | Latencia (< 5 ms) | Napája priamo regulačný okruh. |
| Hĺbka stereo / RGB-D | Vždy na palube | Šírka pásma + latencia | Šírka pásma kamery v surovom formáte je príliš vysoká na odoslanie; hĺbkový výstup je malý, ale je potrebný rýchly výkon. |
| Detekcia objektov triedy YOLO | Preferované na palube | Latencia (10–30 ms reflexívne) | Pasuje na Jetson s 30+ FPS. Nie je dôvod ho pripájať k sieti. |
| Detekcia budiacich slov | Preferované na palube | Výkon + latencia | Vždy zapnutý, spotreba pod wattmi na QRB alebo Hailo. Mimo dosky spotrebuje sieťovú šírku pásma 24 hodín denne, 7 dní v týždni. |
| Malý STT triedy Whisper | Buď | Tolerancia latencie | 100–250 ms na Jetson AGX Orin. Mimo dosky je to 30–80 ms na 5090. Používateľ to nezistí. |
| Malý LLM (≤ 8B Q4) pre dialóg | Buď | Latencia vs. súbežnosť | 15–25 tok/s na Orin AGX, 80–150 tok/s na 5090. Mimo dosky vyhráva, ak potrebujete škálovateľnosť. |
| VLM 3B Q4 (popis scény) | Preferované na palube | Výkon + latencia | Ľahko sa hodí na Orina, nevyžaduje sieť, použiteľné je ~10 FPS. |
| VLM 7B Q4 (Qwen2.5-VL, OpenVLA) | Buď | Výkon vs. snímková frekvencia | Orin AGX dosahuje 5–8 FPS pri 30 W. K-AI dosahuje 30+ FPS. Výber pre každú úlohu. |
| VLM 32B Q4 | Uprednostňované mimo paluby (Thor: okrajové na palube) | Pamäť + výkon | Nepasuje na Orin AGX. Marginálne na Thor 128 GB. Pohodlné na K-AI 96. |
| VLM 70B+ Q4 | Iba mimo paluby | Memory Masážne stoly | 45–50 GB váhy + 10–20 GB KV. Žiadny integrovaný modul toto v roku 2026 nebude hostiť. |
| Plánovač pohybu (krátky horizont, < 1 s) | Preferované na palube | latencia | Úzka slučka s riadením. Lokálna je správna odpoveď. |
| Plánovač pohybu (dlhý horizont, viacnásobné) | Uprednostňované mimo paluby | Pamäť + veľkosť modelu | VLM alebo difúzia založená na rozsiahlom kontexte a mimo nej dosahované výsledky. |
| Pamäť scény / RAG | Iba mimo paluby | Vytrvalosť + pamäť | Musí prežiť reštart robota; vektorové úložisko potrebuje skutočné úložisko a RAM procesora. |
| Fúzia VLM z viacerých kamier (3–5 streamov) | Iba mimo paluby | Pamäť + výpočet | Dávkovanie medzi kamerami vyžaduje server s viacerými GPU. |
| Doladenie / školenie LoRA | Iba mimo paluby | Pamäť + výkon | 2–5× inferenčná pamäť, trvalý výkon v kW triede. Nedeje sa to s batériou. |
| Kompletný predbežný tréning | Iba mimo paluby | Nezmestí sa to ani na jeden server | Viacuzlové územie. Pozri K-trať. |
| Iterácia politiky Isaaca Sima | Iba mimo paluby | Vykresľovanie GPU + priepustnosť RL | V podstate ide o pracovnú záťaž servera. |
Tri čítania tejto tabuľky, ktoré stoja za prečítanie.
Riadky „vždy na palube“ sú fyzika. Žiadna šírka pásma neopraví regulačnú slučku, ktorá vyžaduje odozvu 1 kHz. Tieto sa nikdy nepohnú, bez ohľadu na to, aká dobrá je sieť alebo externé výpočty.
Riadky „buď“ sú miesta, kde dochádza k skutočnému inžinierskemu úsudku. Väčšina zaujímavých kompromisov spočíva práve v tomto. To, či 7B VLM beží integrovane alebo externe, určuje skutočnú časť správania systému. Neexistuje globálne správna odpoveď.
Riadky „iba mimo paluby“ sa pohybujú pomaly. Model 72B pravdepodobne nebude dostupný až v roku 2027. Model 32B sa na palube objaví s tým, ako sa bude Thor dodávať vo veľkom. Hranica „čo sa zmestí do zariadenia“ sa posúva približne o jednu veľkostnú triedu modelu každých 18 – 24 mesiacov.
Mapovanie úrovní latencie
Štvorúrovňový rozpočet latencie od I01 mapy priamo na umiestnenie:
| Stupeň | rozpočet | Umiestnenie |
|---|---|---|
| Reaktívna kontrola | <10 ms | Iba na palube. Bodka. |
| Reflexné vnímanie | 10 - 50 ms | Integrovaný (len spiatočná LAN cesta spotrebuje rozpočet) |
| Deliberatívne plánovanie | 100 ms - 1 s | Buď. LAN funguje, integrované rozhranie funguje. |
| Strategické uvažovanie | 1 s – viacero s | V každom prípade, externé riešenia často vyhrávajú v kvalite modelu. |
Dve stredné vrstvy sú miestom, kde sa prijímajú skutočné rozhodnutia o architektúre. Reflexívna pracovná záťaž, ktorá práve zmestí sa za 50 ms, môže sa zmestiť mimo dosky cez káblovú LAN (0.5 ms tranzit + 40 ms inferencia + 0.5 ms spätný prenos = 41 ms), ale prekročí rozpočet cez Wi-Fi 6E pri záťaži (8 ms × 2 + 40 ms = 56 ms plus jitter). Preto sú káblové tethery dôležité počas vývoja: umožňujú vám zistiť, či je pracovná záťaž zásadne pasuje mimo paluby skôr, ako budete bojovať s bezdrôtovou sieťou.
Sieťová realita
Offboard funguje iba vtedy, ak je sieťová. Skutočné čísla:
| odkaz | Medián RTT | P99 RTT | Jitter pri zaťažení |
|---|---|---|---|
| Káblové 2.5/10 GbE tether | 0.2 - 0.5 ms | 0.5 - 1 ms | Sub-ms |
| Wi-Fi 6E, 6 GHz, priama viditeľnosť, vyhradený prístupový bod | 3 - 10 ms | 15 - 30 ms | Zvládnuteľné |
| Wi-Fi 6 / 6E, zdieľaná 5 GHz, sporná | 8 - 25 ms | 80 - 200 ms | Zlý |
| Wi-Fi 6E pri záťaži (prenos súborov s rovnakým SSID) | 10 - 40 ms | 200 ms - 2 s | Robotické lámanie |
| Mobilné 5G stredné pásmo | 20 - 40 ms | 100 - 300 ms | Premenlivý |
| WAN do cloudu EÚ | 15–40 ms (medián) | 80 - 300 ms | Závislé od BGP |
Pre deliberatívne úlohy (rozpočet 100 ms – 1 s) je Wi-Fi 6E na vyhradenom SSID a prístupovom bode v priamom dosahu postačujúca. Pre reflexívne úlohy (10 – 50 ms) je káblové pripojenie bezpečnou odpoveďou a Wi-Fi 6E je šťastnou odpoveďou. Naplánujte si to podľa toho: ak úloha robota obsahuje akýkoľvek reflexívny externý komponent, navrhnite ho s káblovou možnosťou pre vývoj a záložným režimom pre prípad, že by Wi-Fi klesla.
Hybridný vzorec – rýchle/pomalé rozdelenie
Vzor, ku ktorému sa zbližuje väčšina vážnych nasadení v roku 2026, je rýchle/pomalé rozdelenie VLMmalý VLM integrovaný pre okamžitú spätnú väzbu, veľký VLM externý pre premyslené rozhodnutia, pričom oba poskytujú údaje tomu istému plánovačovi.
Tvar betónu:
- Kadencia 33 ms na snímku
- Napája VLM cesty na doske aj mimo nej
- Qwen2.5-VL-7B na Jetson AGX Orin / Thor
- Výstup 5–10 Hz
- Zhrnutie scény + okamžitá akcia
- Priamo napája reflexnú vrstvu
gRPC
- Qwen2.5-VL-72B na K-AI 96/256
- Výstup 1–3 Hz
- Zvážené zdôvodnenie scény + úprava plánu
- Poskytuje deliberatívnu vrstvu, môže prepísať na palube
Rozdelenie na rýchle/pomalé operácie: palubná 7B sa stará o okamžitú reakciu; externá 72B sa stará o premyslené uvažovanie a aktualizácie plánu.
Rýchly model rieši situáciu „idúca ku mne osoba, spomaľte“. Pomalý model rieši situáciu „idúca ku mne je operátor, ktorý ma požiadal, aby som sa zastavil, ak sa priblíži s červenou doskou, a to je červená doska, takže sa zastavte“. Rýchly model sa najprv zaväzuje k bezpečnému správaniu; pomalý model ho vylepšuje.
Príbeh migrácie – čo sa stane v rokoch 2026 – 2027
Tri sily stláčajú externú stranu: Thor dosahuje objem (2070 FP4 TFLOPS, 128 GB unifikovanej pamäte, 130 W obálka – štrukturálny skok oproti Orinovi); účinnosť VLM sa neustále zlepšuje („dosť dobrý“ dojem, že VLM bol v roku 2024 70B+, v roku 2026 je 32B, v roku 2027 bude pravdepodobne 13B – 20B); a špekulatívne dekódovanie s malými tvorcami modelov vám umožňuje poskytovať kvalitu veľkých modelov s malou latenciou modelov.
Pracovné zaťaženia, ktoré s najväčšou pravdepodobnosťou migrujú na palube v priebehu nasledujúcich 18 mesiacov: scénický VLM triedy 7B (už sa presúva), plánovač LLM triedy 13B (Thor ho robí pohodlným), krátkokontextové STT-LLM-TTS pre hlas, doménovo špecifické doladené VLM triedy 7B.
Pracovné zaťaženia, ktoré nie migrovať: čokoľvek 70B+, pamäť scén v rozsahu flotily, tréning a simulácia, fúzia viacprúdových VLM. Tieto zostávajú mimo základne minimálne do roku 2027. Šírka pásma pamäte a napájanie batérie sa nemenia tak rýchlo.
Dve betónové konfigurácie
Jednotné vzdelávacie zariadenie G1, výskumné laboratórium. Integrovaný AGX Orin spúšťa ROS 2, YOLOv11-s pri 30 FPS, Whisper-distil STT a Qwen2.5-VL 7B INT4 pri 5–8 FPS (zámerne). Externý K-AI 96 (4× RTX 5090, 128 GB VRAM) spúšťa vLLM s Qwen2.5-VL 72B a Qwen2.5 32B textovo-priestorovou pamäťou, pgvector scénickou pamäťou a Isaac Sim na nečinných GPU.
Malá flotila, 3 humanoidi, trieda Thor na palube. Každá jednotka používa systém Hailo-15 Vision SoC pre neustále zapnutú detekciu viacerých kamier, technológiu Whisper-small na zariadení a grafickú kartu Qwen2.5-VL 32B INT4 s frekvenciou 10–15 FPS – natívne, už nie na okraji. Externá grafická karta K-AI 256 (8× RTX 5090, 256 GB VRAM) hostí zdieľané grafické karty Qwen2.5-VL 72B a Llama-3.1 70B na plánovanie, zdieľané úložisko pgvector medzi všetkými tromi robotmi a dve grafické karty vyhradené pre nočné doladenie LoRA.
Kde fungujú čisto jednovrstvové nasadenia
Čisto palubné práce pre úzko zamerané štvornožce (hliadkovanie po obvode s YOLO + termokamerou), teleoperované roboty (operátor je plánovač, v slučke nie je žiadny VLM), demonštračné/vzdelávacie roboty s najmenšími modelmi a akékoľvek nasadenie bez akejkoľvek siete (vonkajšia inšpekcia, vzdialené lokality).
Čistý cloud funguje pre robotickí asistenti ovládajúci iba hlasom bez uzavretej slučky vnímania, prototypy, kde rýchlosť nastavenia prevyšuje všetko ostatné, a nasadenia, kde sa dáta aj tak zámerne ukladajú do cloudového úložiska.
Hybrid je odpoveďou na všetko medzi tým – čo je v roku 2026 zhruba 90 % serióznej robotiky. Ak staviate niečo s vnímaním VLM-in-the-loop, skončíte s oboma úrovňami. Plánujte to od prvého dňa.
Tok rozhodovania
Pri určovaní veľkosti nasadenia:
- Uveďte pracovné zaťaženie. Riadenie motoriky, vnímanie, STT, LLM, VLM, plánovanie, pamäť, tréning. Buďte explicitní.
- Označte každý úrovňou latencie a triedou pamäte (≤ 8 GB / 8–40 GB / 40–80 GB / 80+ GB).
- Použite maticu vyššie, aby ste získali umiestnenie s úspešným absolvovaním.
- Vykonajte audit na palube oproti skutočnému SoC a tepelnému rozpočtu robota. G1 s Orin NX je iný stroj ako T1 s AGX Orin alebo budúcou platformou Thor.
- Porovnajte si úroveň K-AI mimo paluby s úrovňou, ktorú si môžete dovoliť. K-AI 96 je minimálna hodnota pre jedného robota vykonávajúceho serióznu prácu; K-AI 256 je minimálna hodnota pre flotilu robotov alebo akúkoľvek požiadavku na školenie.
- Auditujte sieť. Káblové pripojenie pre vývoj, vyhradené SSID Wi-Fi 6E pre produkciu. Ak vaša reflexná vrstva pretína sieť, naplánujte káblové pripojenie alebo záložné riešenie s plynulým uvoľňovaním.
- Naplánovať migráciu. Keď Thor dodáte na svoju platformu, ktoré pracovné zaťaženia sa presunú na palubu? Abstrahujte hranice gRPC teraz, aby migrácia bola zmenou nasadenia, nie prepísaním.
Následné články (R05, I02, I05) sa hlbšie venujú tu načrtnutým častiam. Rozhodnutia o umiestnení v tomto článku sú lešením, na ktorom všetko ostatné visí.
Úprimný názor: 90 % serióznych nasadení robotiky v roku 2026 bude potrebovať obe úrovne. Palubná časť je dimenzovaná pre bezpečnosť, reflexy a vnímanie malých modelov. Externá časť je dimenzovaná pre VLM-in-the-loop, pamäť scén, plánovanie a tréning. Jednovrstvové nasadenia fungujú pre úzke prípady použitia – a len pre tie.
Toto je súčasť Kentino Wiki, referenčnej série o umelej inteligencii, robotike a systémoch, ktoré ich spájajú. Komentáre a opravy sú vítané na info@kentino.com.