Výpočty na zariadení vs. mimo zariadenia pre roboty

Každá pracovná záťaž na robote sa nachádza na jednom z dvoch miest: na doske, napájaná batériou a ventilátormi na hrudi, alebo mimo dosky, na serveri napájanom zo siete vzdialenom jeden LAN hop. Ťažkou otázkou nie je, či potrebujete obe – takmer vždy ich potrebujete – ale ktorá pracovná záťaž kam ide a prečo . R08 argumentuje, že vyhradená okrajová vrstva vôbec existuje. Tento článok je rozhodnutím pre každú pracovnú záťaž: riadenie motora tu, VLM tam, STT závisí atď.

Rámec je tvrdohlavý. Na každú pracovnú záťaž existuje správna odpoveď a správna odpoveď sa mení, keď sa integrovaný kremík vymkne. Povieme, akým smerom sa každý kus uberá v rokoch 2026 – 2027.

Dva rozpočty, ktoré rozhodujú o všetkom

Zaťaženie môže bežať na palube vtedy a len vtedy, ak sa zmestia do dvoch rozpočtov súčasne: výkonu a pamäte . Latencia je tretím obmedzením, ale latencia zvyčajne hovorí, ktorým smerom posunúť pracovné zaťaženie, ktoré sa zmestilo, nie či sa vôbec zmestilo.

Energetický rozpočet humanoida. Humanoid s hmotnosťou 30 – 50 kg nesie batériu s kapacitou 700 – 900 Wh. Dlhodobá chôdza odoberá z aktuátorov 200 – 500 W, pričom počas dynamického pohybu dosahuje maximálnu spotrebu 800 W a viac. Státie v pokoji a premýšľanie odoberá z aktuátorov 80 – 150 W (udržiavací krútiaci moment je nízky, udržiavanie polohy stojí). Na všetko ostatné – výpočty, senzory, chladiace ventilátory, rádio – zostáva približne 60 – 120 W, ak chcete použiteľný dvojhodinový prevádzkový čas. Výpočtový rozpočet v rámci tohto objemu je 30 – 80 W. Neustále používanie Jetsonu na MAX_N (60 W) znižuje prevádzkový čas robota na polovicu. Toto je nepodstatná fyzika, nie konštrukčná voľba.

Pamäťový rozpočet. Jetson AGX Orin 64 GB je 64 GB pamäte LPDDR5 zdieľanej medzi CPU a GPU . Odpočítajte OS (4–6 GB), ROS 2 a SDK výrobcu (2–4 GB), vyrovnávacie pamäte vnímania (2–4 GB pre stereo hĺbku a bodové mračná) a akýkoľvek aplikačný kód. Realistický rozpočet využiteľný pre LLM/VLM je 40–48 GB. Na module Jetson Thor 128 GB sa strop zvýši na ~96 GB použiteľných. Na Orin NX 16 GB sa zníži na ~8–10 GB použiteľných – dosť pre jeden malý model.

Mimo hry predstavujú oba rozpočty odlišný problém. Kentino AI 96 (4× RTX 5090) má 128 GB vyhradenej VRAM a 1.0–1.5 kW výkonu GPU pri zapojení do siete. Kentino AI 256 (8× RTX 5090) zdvojnásobuje oboje. Výkon a pamäť jednoducho prestávajú byť obmedzením – namiesto toho ich vymeníte za kapitálové výdavky, vykurovanie, vetranie a klimatizáciu v miestnosti a káblové pripojenie.

Vstavaný kremík, realita roku 2026

Palubné možnosti, ktoré sa dnes skutočne dodávajú v serióznych humanoidoch a štvornožcoch:

SoC INT8 TOPS (riedke) Použiteľná pamäť Napájacia obálka Čo dokáže spustiť
Jetson Orin NX 16 GB 100 ~10 GB zdieľaných 10 – 25 W YOLO, malý VLM 3B Q4, budíkové slovo
Jetson AGX Orin 64 GB 275 ~40 GB zdieľaných 15 – 60 W YOLO, VLM 7B Q4 za použiteľné sadzby, 13B LLM
Jetson AGX Thor 128 GB (2026) 2070 FP4 TFLOPS ~96 GB zdieľaných 40 – 130 W VLM 32B Q4 s dostatkom priestoru, vnímanie duálneho prúdu
Snapdragon 8 Gen 3 / trieda QRB 45-75 Zdieľaných ~6–10 GB 5 – 15 W Hlasový, budíkový, svetelný životopis
Hailo-8 (doplnok M.2) 26 INT8 VRCH 2–4 GB na čipe Typický výkon 2.5 W Odľahčenie vizuálneho kanála, MobileNet/YOLO
Hailo-15 (SoC Vision) 20 TOPS Obyvateľ potrubia 2 – 5 W Vždy zapnutý životopis s viacerými kamerami
Koprocesor Intel N97 / i7-1370P neuvedené (CPU + iGPU) Hostiteľ DDR5 6 – 45 W Orchestrácia na vysokej úrovni, ROS 2, lepidlo

Thor je skoková zmena, nie iterácia. Pamäťový strop 128 GB a tenzorové jadrá Blackwell natívne pre FP4 posúvajú hranicu integrovaných procesorov z „7B VLM, bolestivo“ na „32B VLM, užitočne“ v priebehu jednej generácie. Pracovné zaťaženia, ktoré boli v roku 2025 štrukturálne mimo palubného procesora – stredne veľké VLM, kontinuálne titulkovanie scén, stredne veľké plánovače LLM – sa stanú kandidátmi na integrované procesory v roku 2026, ak tepelné riešenie robota dokáže udržať 100 – 130 W.

Hailo a špecializovaná trieda NPU nie sú akcelerátory LLM. Ide o odľahčenie vizuálneho kanála: hlavný Jetson nechajte voľný pre väčší model, spustite vždy zapnutú CV kamery (detekcia objektov, sledovanie, základný VLM-lite) na 3 W čipe.

Trieda Snapdragon QRB je riešením pre roboty zamerané predovšetkým na hlas – prebudenie slovami, tvarovanie lúča, STT – kde je Jetson prehnaný a Cortex-M poddimenzovaný. Užitočný, úzky, čoraz bežnejší.

Mimo paluby: úroveň AI Kentino ako referencia

Cieľom mimo dosky, na ktorý sa táto séria odvoláva, je rad Kentino AI – napájaný zo steny, 4U alebo 5U rack, 4 alebo 8 GPU na EPYC alebo Xeon, na 10 GbE prepínači jeden skok od robota. Tri úrovne, ktoré sú dôležité pre robotiku:

Stupeň GPU Agregovaná VRAM Trvalý výkon Najväčší realistický VLM (INT4)
Kentino AI 64 / 96 (4 GPU) 4× RTX 5090 alebo 4× Pro 6000 128 - 384 GB 1.8–2.4 kW 72B s miestom pre vyrovnávaciu pamäť KV
Kentino AI 128 (4× Pro 6000 Blackwell) 4× RTX Pro 6000 96 GB 384 GB 2.0–2.6 kW 72B s plným kontextom
Kentino AI 256 (8 GPU) 8× RTX 5090 alebo 8× Pro 6000 256 - 768 GB 3.5–4.5 kW 70B + 32B + 7B súčasne

Rozhodovacia matica

Každé robotické zaťaženie sa prehľadne zaraďuje do jednej z piatich kategórií: vždy na doske , uprednostňované na doske , ktorékoľvek z nich , uprednostňované mimo dosky , iba mimo dosky . Dôvodom pre každé umiestnenie je záväzný rozpočet – výkon, pamäť alebo latencia.

Pracovná záťaž Umiestnenie Väzbové obmedzenie Prečo
Riadiaca slučka motora (500 Hz – 1 kHz) Vždy na palube Latencia (< 1 ms) Sieťový skok je 100 – 10 000-násobok rozpočtu slučky. Bez výnimiek.
Bezpečnostné reflexy kĺbov / núdzové zastavenie Vždy na palube Latencia (< 5 ms) Z rovnakého dôvodu; musí fungovať aj vtedy, keď je LAN nefunkčná.
Fúzia senzorov IMU Vždy na palube Latencia (< 5 ms) Napája priamo regulačný okruh.
Hĺbka stereo / RGB-D Vždy na palube Šírka pásma + latencia Šírka pásma kamery v surovom formáte je príliš vysoká na odoslanie; hĺbkový výstup je malý, ale je potrebný rýchly výkon.
Detekcia objektov triedy YOLO Preferované na palube Latencia (10–30 ms reflexívne) Pasuje na Jetson s 30+ FPS. Nie je dôvod ho pripájať k sieti.
Detekcia budiacich slov Preferované na palube Výkon + latencia Vždy zapnutý, spotreba pod wattmi na QRB alebo Hailo. Mimo dosky spotrebuje sieťovú šírku pásma 24 hodín denne, 7 dní v týždni.
Malý STT triedy Whisper Buď Tolerancia latencie 100–250 ms na Jetson AGX Orin. Mimo dosky je to 30–80 ms na 5090. Používateľ to nezistí.
Malý LLM (≤ 8B Q4) pre dialóg Buď Latencia vs. súbežnosť 15–25 tok/s na Orin AGX, 80–150 tok/s na 5090. Mimo dosky vyhráva, ak potrebujete škálovateľnosť.
VLM 3B Q4 (popis scény) Preferované na palube Výkon + latencia Ľahko sa hodí na Orina, nevyžaduje sieť, použiteľné je ~10 FPS.
VLM 7B Q4 (Qwen2.5-VL, OpenVLA) Buď Výkon vs. snímková frekvencia Orin AGX dosahuje 5–8 FPS pri 30 W. Kentino AI dosahuje 30+ FPS. Výber pre každú úlohu.
VLM 32B Q4 Uprednostňované mimo paluby (Thor: okrajové na palube) Pamäť + výkon Nepasuje na Orin AGX. Marginal na Thor 128 GB. Comfort na Kentino AI 96.
VLM 70B+ Q4 Iba mimo paluby Memory Masážne stoly 45–50 GB váhy + 10–20 GB KV. Žiadny integrovaný modul toto v roku 2026 nebude hostiť.
Plánovač pohybu (krátky horizont, < 1 s) Preferované na palube latencia Úzka slučka s riadením. Lokálna je správna odpoveď.
Plánovač pohybu (dlhý horizont, viacnásobné) Uprednostňované mimo paluby Pamäť + veľkosť modelu VLM alebo difúzia založená na rozsiahlom kontexte a mimo nej dosahované výsledky.
Pamäť scény / RAG Iba mimo paluby Vytrvalosť + pamäť Musí prežiť reštart robota; vektorové úložisko potrebuje skutočné úložisko a RAM procesora.
Fúzia VLM z viacerých kamier (3–5 streamov) Iba mimo paluby Pamäť + výpočet Dávkovanie medzi kamerami vyžaduje server s viacerými GPU.
Doladenie / školenie LoRA Iba mimo paluby Pamäť + výkon 2–5× inferenčná pamäť, trvalý výkon v kW triede. Nedeje sa to s batériou.
Kompletný predbežný tréning Iba mimo paluby Nezmestí sa to ani na jeden server Viacuzlové územie. Pozri K-trať.
Iterácia politiky Isaaca Sima Iba mimo paluby Vykresľovanie GPU + priepustnosť RL V podstate ide o pracovnú záťaž servera.

Tri čítania tejto tabuľky, ktoré stoja za prečítanie.

Riadky „vždy na palube“ sú fyzikálne. Žiadna šírka pásma neopravuje riadiacu slučku, ktorá vyžaduje odozvu 1 kHz. Tieto sa nikdy nepohnú, bez ohľadu na to, aká dobrá je sieť alebo externé výpočty.

V riadkoch „buď“ sa vykonáva skutočné inžinierske posúdenie. Tu sa nachádza väčšina zaujímavých kompromisov. To, či 7B VLM beží integrovane alebo externe, určuje skutočnú časť správania systému. Neexistuje globálne správna odpoveď.

Riadky „iba mimo palubnej dosky“ sa posúvajú pomaly. Model 72B bude pravdepodobne stále iba mimo palubnej dosky v roku 2027. Model 32B sa presunie na palubnú dosku s tým, ako sa Thor bude dodávať vo veľkom. Hranica „čo sa zmestí do zariadenia“ sa posúva približne o jednu veľkostnú triedu modelu každých 18 – 24 mesiacov.

Mapovanie úrovní latencie

Štvorúrovňový rozpočet latencie z I01 sa priamo mapuje na umiestnenie:

Stupeň rozpočet Umiestnenie
Reaktívna kontrola <10 ms Iba na palube. Bodka.
Reflexné vnímanie 10 - 50 ms Integrovaný (len spiatočná LAN cesta spotrebuje rozpočet)
Deliberatívne plánovanie 100 ms - 1 s Buď. LAN funguje, integrované rozhranie funguje.
Strategické uvažovanie 1 s – viacero s V každom prípade, externé riešenia často vyhrávajú v kvalite modelu.

Dve stredné úrovne sú miestom, kde sa skutočne rozhodovať o architektúre. Reflexívna pracovná záťaž, ktorá sa zmestí len za 50 ms, sa môže zmestiť mimo dosky cez káblovú LAN (0.5 ms tranzit + 40 ms inferencia + 0.5 ms spätný prenos = 41 ms), ale prekročí rozpočet cez Wi-Fi 6E pri záťaži (8 ms × 2 + 40 ms = 56 ms plus jitter). Preto sú káblové tethery dôležité počas vývoja: umožňujú vám zistiť, či sa pracovná záťaž zásadne zmestí mimo dosky ešte predtým, ako začnete bojovať s bezdrôtovou sieťou.

Sieťová realita

Offboard funguje iba vtedy, ak je sieťová. Skutočné čísla:

odkaz Medián RTT P99 RTT Jitter pri zaťažení
Káblové 2.5/10 GbE tether 0.2 - 0.5 ms 0.5 - 1 ms Sub-ms
Wi-Fi 6E, 6 GHz, priama viditeľnosť, vyhradený prístupový bod 3 - 10 ms 15 - 30 ms Zvládnuteľné
Wi-Fi 6 / 6E, zdieľaná 5 GHz, sporná 8 - 25 ms 80 - 200 ms Zlý
Wi-Fi 6E pri záťaži (prenos súborov s rovnakým SSID) 10 - 40 ms 200 ms - 2 s Robotické lámanie
Mobilné 5G stredné pásmo 20 - 40 ms 100 - 300 ms Premenlivý
WAN do cloudu EÚ 15–40 ms (medián) 80 - 300 ms Závislé od BGP

Pre deliberatívne úlohy (rozpočet 100 ms – 1 s) je Wi-Fi 6E na vyhradenom SSID a prístupovom bode v priamom dosahu postačujúca. Pre reflexívne úlohy (10 – 50 ms) je káblové pripojenie bezpečnou odpoveďou a Wi-Fi 6E je šťastnou odpoveďou. Naplánujte si to podľa toho: ak úloha robota obsahuje akýkoľvek reflexívny externý komponent, navrhnite ho s káblovou možnosťou pre vývoj a záložným režimom pre prípad, že by Wi-Fi klesla.

Hybridný vzorec – rýchle/pomalé rozdelenie

Vzor, ku ktorému sa zbližuje väčšina serióznych nasadení v roku 2026, je rozdelenie rýchleho/pomalého VLM : malý VLM integrovaný pre okamžitú spätnú väzbu, veľký VLM externý pre premyslené rozhodnutia, pričom oba zdroje údajov poskytuje tomu istému plánovačovi.

Tvar betónu:

Rámček kamery — 30 FPS
  • Kadencia 33 ms na snímku
  • Napája VLM cesty na doske aj mimo nej

Palubný VLM 7B Q4
  • Qwen2.5-VL-7B na Jetson AGX Orin / Thor
  • Výstup 5–10 Hz
  • Zhrnutie scény + okamžitá akcia
  • Priamo napája reflexnú vrstvu

gRPC
Mimo palubného VLM 72B Q4
  • Qwen2.5-VL-72B na Kentino AI 96/256
  • Výstup 1–3 Hz
  • Zvážené zdôvodnenie scény + úprava plánu
  • Poskytuje deliberatívnu vrstvu, môže prepísať na palube

Rozdelenie na rýchle/pomalé operácie: palubná 7B sa stará o okamžitú reakciu; externá 72B sa stará o premyslené uvažovanie a aktualizácie plánu.

Rýchly model rieši situáciu „idúca ku mne osoba, spomaľte“. Pomalý model rieši situáciu „idúca ku mne je operátor, ktorý ma požiadal, aby som sa zastavil, ak sa priblíži s červenou doskou, a to je červená doska, takže sa zastavte“. Rýchly model sa najprv zaväzuje k bezpečnému správaniu; pomalý model ho vylepšuje.

Príbeh migrácie – čo sa stane v rokoch 2026 – 2027

Tri sily stláčajú externú stranu: Thor dosahuje objem (2070 FP4 TFLOPS, 128 GB unifikovanej pamäte, 130 W obálka – štrukturálny skok oproti Orinovi); účinnosť VLM sa neustále zlepšuje („dosť dobrý“ dojem, že VLM bol v roku 2024 70B+, v roku 2026 je 32B, v roku 2027 bude pravdepodobne 13B – 20B); a špekulatívne dekódovanie s malými tvorcami modelov vám umožňuje poskytovať kvalitu veľkých modelov s malou latenciou modelov.

Pracovné zaťaženia, ktoré s najväčšou pravdepodobnosťou migrujú na palube v priebehu nasledujúcich 18 mesiacov: scénický VLM triedy 7B (už sa presúva), plánovač LLM triedy 13B (Thor ho robí pohodlným), krátkokontextové STT-LLM-TTS pre hlas, doménovo špecifické doladené VLM triedy 7B.

Úlohy, ktoré nemigrujú : čokoľvek s veľkosťou 70B+, pamäť scén v rozsahu flotily, tréning a simulácia, fúzia viacstreamových VLM. Tieto zostávajú mimo systému minimálne do roku 2027. Šírka pásma pamäte a napájanie batérie sa tak rýchlo nemenia.

Dve betónové konfigurácie

Jedna G1 EDU, výskumné laboratórium. Integrovaný AGX Orin spúšťa ROS 2, YOLOv11-s pri 30 FPS, Whisper-distil STT a Qwen2.5-VL 7B INT4 pri 5–8 FPS (zámerné). Externý Kentino AI 96 (4× RTX 5090, 128 GB VRAM) spúšťa vLLM s Qwen2.5-VL 72B a Qwen2.5 32B textovo-priestorovou pamäťou, pgvector scénickou pamäťou a Isaac Sim na nečinných GPU.

Malá flotila, 3 humanoidi, palubný robot triedy Thor. Každá jednotka používa systém na čipe Hailo-15 pre neustále zapnutú detekciu viacerých kamier, funkciu Whisper-small na zariadení a grafiku Qwen2.5-VL 32B INT4 s frekvenciou 10–15 FPS – natívne, už nie na okraji. Externá AI 256 (8× RTX 5090, 256 GB VRAM) hostí zdieľané čipy Qwen2.5-VL 72B a Llama-3.1 70B na plánovanie, zdieľané úložisko pgvector medzi všetkými tromi robotmi a dve grafické karty vyhradené pre nočné doladenie LoRA.

Kde fungujú čisto jednovrstvové nasadenia

Čisto palubné práce pre úzko zamerané štvornohé roboty (hliadkovanie po obvode s YOLO + termokamera), teleoperované roboty (operátor je plánovač, žiadny VLM v slučke), demonštračné/vzdelávacie roboty s najmenšími modelmi a akékoľvek nasadenie bez akejkoľvek siete (vonkajšia inšpekcia, vzdialené lokality).

Čistý cloud funguje pre robotických asistentov ovládajúcich iba hlasom bez uzavretej slučky vnímania, prototypy, kde rýchlosť nastavenia prevyšuje všetko ostatné, a nasadenia, kde sa dáta zámerne aj tak prenášajú do cloudovej záťaže.

Hybrid je odpoveďou na všetko medzi tým – čo je v roku 2026 zhruba 90 % serióznej robotiky. Ak staviate niečo s vnímaním VLM-in-the-loop, skončíte s oboma úrovňami. Plánujte to od prvého dňa.

Tok rozhodovania

Pri určovaní veľkosti nasadenia:

  1. Uveďte pracovné zaťaženie. Riadenie motoriky, vnímanie, STT, LLM, VLM, plánovanie, pamäť, tréning. Buďte explicitní.
  2. Označte každý úrovňou latencie a triedou pamäte (≤ 8 GB / 8–40 GB / 40–80 GB / 80+ GB).
  3. Použite maticu vyššie, aby ste získali umiestnenie s úspešným absolvovaním.
  4. Vykonajte audit na palube oproti skutočnému SoC a tepelnému rozpočtu robota. G1 s Orin NX je iný stroj ako T1 s AGX Orin alebo budúcou platformou Thor.
  5. Porovnajte si externý audit s úrovňou umelej inteligencie Kentino, ktorú si môžete dovoliť. Kentino AI 96 je ideálna pre jedného robota vykonávajúceho serióznu prácu; Kentino AI 256 je ideálna pre flotilu robotov alebo akúkoľvek požiadavku na školenie.
  6. Auditujte sieť. Káblové pripojenie pre vývoj, vyhradené SSID Wi-Fi 6E pre produkciu. Ak vaša reflexná vrstva pretína sieť, naplánujte káblové pripojenie alebo záložné riešenie s plynulým uvoľňovaním.
  7. Naplánovať migráciu. Keď Thor dodáte na svoju platformu, ktoré pracovné zaťaženia sa presunú na palubu? Abstrahujte hranice gRPC teraz, aby migrácia bola zmenou nasadenia, nie prepísaním.

Nasledujúce články ( R05 , I02, I05) sa hlbšie venujú načrtnutým častiam. Rozhodnutia o umiestnení v tomto článku sú lešením, na ktorom všetko ostatné visí.

Úprimný názor: 90 % serióznych nasadení robotiky v roku 2026 bude potrebovať obe úrovne. Palubná časť je dimenzovaná pre bezpečnosť, reflexy a vnímanie malých modelov. Externá časť je dimenzovaná pre VLM-in-the-loop, pamäť scén, plánovanie a tréning. Jednovrstvové nasadenia fungujú pre úzke prípady použitia – a len pre tie.


Toto je súčasť Kentino Wiki, referenčnej série o umelej inteligencii, robotike a systémoch, ktoré ich spájajú. Pripomienky a opravy sú vítané na adrese info@kentino.com.

Späť na blog