KOL Digest
Semianalysis · 2026.09.14 週一 · Substack

A Brain Too Big to Carry — On-Device vs Datacenter Inference

看原始內容 2 個主題 · 7 個標的/題材

通用機器人推論架構分層:端側控制與雲端 System 2 推理之分流

  • —機器人模型呈現階層化分工,100Hz 以上的動作與伺服控制層因延遲預算低於 10ms 必須留在端側,而 20Hz 以下的規劃與推理層則具備足夠延遲餘裕移往資料中心運算
  • —大腦模型已達千億至兆級參數,若強行部署於機器人將迅速耗盡電池與散熱預算,推動如波士頓動力將 System 2 推理託管於 Google TPU 雲端
$NVDA 中期

$NVDA 雖然以 Jetson Thor 壟斷高階機器人端側算力,但 Thor 算力與 記憶體 頻寬僅約 GB200 的十分之一與三十分之一。在 先進製程 與晶圓產能排擠下,NVIDIA 將優先向資料中心傾斜。隨著通用模型參數膨脹,機器人端側晶片性能上限將促使高階推理算力向雲端資料中心架構遷移

$GOOGL 中期

波士頓動力 Atlas 採用 DeepMind 的 Gemini Robotics ER 作為 System 2 規劃大腦,並透過 Orbit 平台連接 Google TPU 雲端進行多模態推理。透過雲端旗艦多模態模型提供語義解析與工作調度,已成突破端側硬體算力瓶頸的關鍵合作路徑

機器人 ↑看多 長期

通用機器人為因應非結構化環境必須具備高階推理能力,促使業界從單純端側運算轉向「端側 VLA 執行 + 雲端 System 2 規劃」的分層架構。推理與控制的分層解耦將打破端側功耗與體積限制,加速通用機器人進入工廠與物流場景

AI算力 ↑看多 長期

實體 AI 與具身智慧的崛起正開拓文字與對話之外的第二運算戰場,機器人規劃層每數秒至每秒數次的雲端調用將創造龐大的資料中心推論負載。具身智慧的普及將為雲端 AI 算力基礎設施帶來龐大且持續的即時推論需求增量

機器人推論 TCO 與矽晶圓效率:B300 雲端共享對決 Jetson Thor 端側晶片

  • —在晶圓與 DRAM 產能緊缺下,當單顆 GPU 能同時服務 7 台以上機器人時,雲端共享架構的 先進製程 晶圓使用效率即超越全端側配置
  • —工業場景端側利用率僅約 40%,而資料中心 B300 伺服器 可達 90% 共享利用率,使 B300 雲端推論的單位算力 TCO 僅為端側 Jetson Thor 的 46%
$NVDA 中期

以 RoboTTT 模型架構評估,單顆 $NVDA B300 GPU 在 500ms 延遲預算內可同時服務 12 台機器人,而 RTX 6000 Pro 僅能服務 4 台。在考量硬體折舊與使用率後,B300 雲端推論展現壓倒性的 TCO 成本優勢。當單顆 B300 負載達 5 台機器人以上時,雲端推論的總持有成本即顯著低於全機搭載 Jetson Thor

機器人 中期

機器人算力架構面臨 TCO 成本與網路穩定性的權衡,雖然家庭環境因 WiFi 抖動迫使業者如 Sunday Robotics 回歸端側,但工業環境在專網布建下將由雲端推論勝出。規模化部署後的單位算力經濟性將主導工業機器人朝向雲端共享算力架構收斂

半導體 中期

機器人晶片隨性能提升正快速收斂至 TSMC N4、N3 與 N2 等 先進製程,但在總量尚未爆發前將持續排在資料中心 GPU 之後爭奪晶圓與非 HBM 記憶體 產能。共享雲端 GPU 的高晶圓利用率將是緩解先進製程產能排擠與降低邊際成本的關鍵解方

每天早上,收件匣見

53 位中英文財經 KOL 的觀點,每天自動整理成一份日報。免費,隨時可退訂。

免費訂閱