跳至主要內容
Agchub Agchub

200赫茲對300毫秒:機器人的大腦放身體還是雲端,先算三層時間預算

從三層控制迴路的時間預算、機上晶片攤提與雲端租金的每小時試算,到55B與3.3B參數量的可行性分界,拆解機器人大腦放身體還是放雲端的成本與延遲帳。

/ 編輯部 #人形機器人、邊緣運算、成本結構
200赫茲對300毫秒:機器人的大腦放身體還是雲端,先算三層時間預算

一臺人形機器人從重心偏移到摔在地面,全程約0.3至0.5秒。這段時間裡,腰部與膝關節的平衡控制器已經刷新了上百次。

同一具身體上,視覺語言模型的思考頻率只有每秒一到十次;把影像送上雲端、等決策傳回來,單程往返一百到三百毫秒起跳。三種速度同時存在一具機體內,這道在問答平臺上反覆出現的題目,在2025年人形機器人進入量產節奏後,已經從技術論戰變成物料成本表上一行行的數字。答案也從二選一,變成分層分配。

三個迴路,三種時間預算

全身運動控制是第一層。步態與平衡通常以每秒200到1,000次刷新,單次預算在1到5毫秒之間,任何網路抖動都等於讓機器人閉著眼走路。2015年DARPA機器人挑戰賽刻意降速參賽隊伍的通訊頻寬以模擬災區環境,通訊一斷,依賴遠端操控的機器人只能停等,多支隊伍當天在場上摔倒。這層教訓後來寫進主流設計:安全與平衡迴路必須留在機身內,沒有例外。

第二層是感知與任務決策。Figure在2025年2月發表的Helix架構給出一組公開數據:高階視覺語言策略S1參數量7B,每秒運行7到9次;低階運動策略V0參數量僅80M,以每秒200次輸出關節指令。兩者合計由兩顆低功耗嵌入式GPU承擔,神經網路推理總功耗約30瓦。也就是說,多數人想像中最喫算力的「思考」環節,頻率與功耗需求比平衡控制低了一到兩個量級。

第三層是訓練、地圖更新與艦隊級資料彙整,時間尺度以分鐘到小時計。這一層最接近2010年任職Google的James Kuffner提出cloud robotics一詞時的原始設想:把大腦外包給雲端。十五年後回看,這個設想只在第三層成立。

機器人運算依時間預算分三層:全身運動控制每秒200至1000次必須留在機身內完成,視覺語言決策每秒1至10次可由機身或近端雲承接,訓練與艦隊資料彙整屬分鐘到小時級由雲端負責

每小時0.27美元對0.3美元:帳面打平之後比什麼

機上方案的代價直接寫在報價單上。輝達Jetson AGX Orin開發者套件定價1,999美元,整數算力275 TOPS,功耗15到60瓦;2025年8月開賣的Jetson Thor開發者套件定價3,499美元,FP4算力約2,070 TFLOPS,功耗上限130瓦,Agility、Boston Dynamics、Figure、宇樹與銀河通用都列在首批採用名單。

功耗這一欄比價格更硬。宇樹G1起售價9.9萬元人民幣,電池9,000mAh,官方續航約兩小時,回推整機平均功耗落在數十瓦量級。把一顆130瓦的Thor裝進這種機身,等於讓推理喫掉全機的電力預算,電池容量、重量與成本必須等比放大。

雲端方案的帳則攤在每小時。以單顆H100每小時2到4美元的租用行情取中值3美元,決策頻率只有個位數赫茲,十臺機器人分時共用一顆GPU在工程上可行,每臺每小時約0.3美元。機上方案若以3,500美元攤提三年、每天運轉12小時,每小時約0.27美元。兩者帳面幾乎打平。

打平之後,比的是不在報價單上的項目:工廠與地下室的訊號死角、電梯內的斷聯、工業現場99.9%以上的可用率要求,以及功能安全標準對本地反應時間的硬性規定。雲端真正的優勢在彈性,模型更新、尖峯擴容、艦隊級學習,這些用租的比自建劃算;穩態推理則是機上晶片攤提較便宜。

成本試算圖卡比較兩種運算位置的每小時費用:機上晶片以3,500美元攤提三年每天運轉12小時約每小時0.27美元,雲端H100由十臺機器人分時共用後每臺約每小時0.3美元,兩者帳面接近

55B上不了機,3.3B可以:模型尺寸畫出的分界線

分界線畫在哪裡,由模型參數量決定。2023年7月Google DeepMind發表RT-2,建立在550億參數的PaLI-X之上,推理放在雲端TPU,機器人每秒向雲端求助一到五次,抓取一個物件等得起幾秒鐘的延遲。2024年底Physical Intelligence的π0把參數量壓到3.3B,2025年Figure的Helix整組系統全數上機。

兩年內從55B到7B,靠的是蒸餾與強化學習:雲端的教師模型大量產出示範資料,訓練出小一到兩個量級的學生模型裝進機身。技能取得從預編程轉向強化學習的成本變化,先前在銀河通用網球機器人的陪練帳裡已經算過一次,90.9%的正手成功率來自訓練階段的反覆自我對打,這些算力支出全部發生在上機之前,不佔用機身資源。

這套分工讓雲端與機身脫離競爭關係。雲端收訓練的錢,機身晶片收推理的錢,剩下的問題只有一個:第二層決策往哪邊傾斜。

統計圖卡呈現兩代機器人基礎模型的參數量對比:2023年Google RT-2的55B參數需在雲端TPU推理,2024年Physical Intelligence的π0縮至3.3B後具備上機執行的可行性

確定性的錢歸晶片,彈性的錢歸雲端

受惠方相當清楚。晶片端,每一臺人形機器人至少內建一顆推理晶片,輝達Jetson系列之外,高通、地平線與華為昇騰都有對應產品線;先前的中誠華隆HL200能效比換算採同一套邏輯,上機運算的第一個約束是瓦特而非TOPS。以年出貨10萬臺、單顆500美元的假設試算,光推理晶片就是5億美元市場,記憶體、散熱與電源管理另有加成。高盛2024年將2035年全球人形機器人市場規模預測上調至380億美元,運算環節的單機價值佔比明顯高於一般傳統零組件。

雲端受惠的是訓練與仿真。輝達Isaac Sim、各家的強化學習叢集、艦隊資料彙整平臺,全部按GPU小時計費,這部分的支出隨模型競賽升溫而膨脹。

承壓方有兩類。走純雲端推理路線的團隊,面對功能安全認證幾乎無解,安全迴路本地化是法規底線;另一類是把專用5G當成必要條件的電信方案,在分層架構下,機器人對網路的依賴被壓縮到第三層,專網的商業論述跟著縮水。

實務上,頭部廠商全部走向混合配比。1X的家用機器人NEO由機身內的輝達晶片負責平衡與安全,較重的推理放雲端,必要時切換真人遠端接管;特斯拉是另一個極端,HW3以來144 TOPS全數上機,雲端只收訓練與資料回傳。兩種配比不同,分層原則一致。

收束:分界線會移動,收錢的順序不變

分界線的位置由兩個變數決定。若旗艦模型繼續膨脹,第二層決策向雲端移動,機器人愈像一臺終端裝置,雲端與網路服務的議價力上升;若蒸餾效率持續改善,3到10B的有效模型留在機身,雲端退回訓練工廠的角色。兩條路徑都不改變兩件事:安全與平衡迴路留在機身內,訓練與彙整留在雲端。

大腦的終局位置難以預測,可追蹤的指標是單機運算功率與運算環節在整機成本中的佔比。晶片與記憶體先收錢,網路與雲端服務後收錢,這個順序在兩種情境下都成立。至於機器人到底「長腦」在身體裡還是雲端上,產業用物料表給出的答案是在身體裡、也在雲端,各自負責自己時間預算內的工作。