KOL Digest
Semianalysis · 2026.09.09 週三 · Substack

Where Does a Robot Think – On-Device vs Datacenter Inference

看原始內容 3 個主題 · 10 個標的/題材

具身智能架構分水嶺:階層式解耦推動重算力規劃層上雲

  • 通用具身智能(如 14B 規模的 DreamZero 或 5B 的 π0.7)不同於傳統工廠專用機器人,需要龐大基礎模型進行空間感知與任務規劃,算力需求遠超邊緣晶片負載極限。
  • 階層式架構將機器人大腦拆解為規劃層(幾 Hz 更新、非同步容忍網路延遲)與動作控制層(數百 Hz 即時安全迴路),為運算卸載至資料中心提供架構基礎。
$NVDA 長期

NVIDIA 的 DreamZero 採用 14B 視訊擴散世界動作模型(WAM),需要兩張 GB200 才能達成即時推論,若移植至 Jetson Thor 幀率將崩跌至 1Hz 以下。前沿機器人模型的巨大 FLOPs 消耗使得邊緣晶片難以獨立負載,迫使頭部模型開發商轉向雲端 GPU 集中推論

機器人 看多 長期

具身智能正從傳統規則驅動走向資料驅動的通用機器人,但受限於電池容量與單機 BoM 成本,難以在每台機器人身上配置千瓦級液冷算力。階層式推論將高階認知卸載至雲端、本地僅保留高頻安全迴路,是通用機器人打破單機算力與功耗枷鎖的必然路徑

AI算力 看多 長期

機器人推論的 Token 流呈現穩定節奏,透過專用 ISP 與編解碼晶片壓縮影像,頻寬受限度低於 LLM,但 WAM 的視訊去噪使運算強烈受限於 FLOPs。視訊擴散架構的引入大幅推升了實體 AI 的算力密度要求,資料中心級算力將成為通用具身智能落地的核心基礎設施

先進製程晶圓與記憶體排擠:雲端共享架構的矽效率拐點

  • NVIDIA 晶片產能幾乎全數由資料中心 GPU 主導,$NVDA Blackwell 毛利率達 70% 尾段且享有台積電先進製程優先配額,低毛利的 Jetson 晶片難以爭奪稀缺晶圓。
  • Jetson Thor 搭載 128GB LPDDR5X,未來世代記憶體需求持續增加,與 記憶體 原廠的 HBM 爭搶非 HBM 晶圓產能,單機搭載模式面臨嚴峻供應鏈瓶頸。
$NVDA 中期

Blackwell 資料中心晶片享有遠高於 Jetson 的毛利率與晶圓配發優先權,且 Jetson Thor 轉移至 TSMC N4 後正與資料中心旗艦直接競爭產能。先進製程記憶體供應受限下,NVIDIA 將優先把先進晶圓資源配置給高毛利的資料中心 GPU 而非邊緣模組

$TSM 長期

$TSM 的 N4、N3 與未來 N2 節點產能持續被 AI 加速器搶佔,邊緣 機器人 晶片雖年出貨量未達千萬片級別,但每台單獨配備邊緣晶片將加劇先進產能消耗。雲端共享架構大幅降低每台機器人的晶圓消耗量,有助於在先進製程產能緊繃環境下實現規模化擴張

先進製程 長期

機器人 晶片正迅速追趕先進製程節點,但共享資料中心推論架構在每顆 GPU 服務超過 7 台機器人時,每台機器的晶圓消耗面積即低於全邊緣配置。當晶圓代工產能成為稀缺資源時,能最小化單機先進晶圓面積的共享架構將具備更高的擴展性

記憶體 長期

記憶體原廠產能向 HBM 傾斜壓縮了 LPDDR 晶圓份額,而每 GPU 服務超過 5 台 機器人 時,雲端集中架構所消耗的總 DRAM 容量即低於全邊緣配置。雲端集中推論能大幅提升記憶體使用效率,規避邊緣機器人對大容量 LPDDR 供應鏈的過度依賴

資料中心推論實測與 TCO:B300 時分多工驅動 56 台機器人

  • 世界動作模型(WAM)在 Batch Size 為 1 時即達到運算飽和,批次化無法提升吞吐反而增加排隊延遲,因此必須採用循序時分多工(Time-multiplexing)調度。
  • 在 10ms 網路往返與 1.6 秒動作區塊延遲預算下,單張 B300 的 p99 延遲為 1.16 秒,能穩定支援 7 台機器人而不發生動作停頓。
$NVDA 中期

實測 DreamZero 在 $NVDA B300 上的推論表現,結合 NVFP4 量化與 DiT 快取,單張 GPU 可時分多工服務 7 台機器人,一套 B300 NVL8 伺服器即可驅動 56 台機器人。透過伺服器集中託管機器人認知層,相較於 56 台各自搭載 Jetson Thor 的邊緣配置展現出顯著的總擁有成本優勢

伺服器 看多 中期

一套 Blackwell 世代的 B300 NVL8 伺服器可同時驅動 56 台前沿通用機器人,推動工廠與倉儲現場部署專用近場推論伺服器。企業級推論伺服器將隨具身智能規模化落地而延伸至邊緣資料中心,開闢高價值 AI 伺服器新市場

機器人 看多 中期

藉由 10ms 局域網路低延遲回傳與 1.6 秒動態緩衝,雲端集中推論成功在維持即時安全性的前提下大幅降低每台機器人的前期硬體成本。時分多工架構驗證了雲端集中推論的工程可行性,為機器人硬體降本與大規模商用奠定經濟基礎

每天早上,收件匣見

53 位中英文財經 KOL 的觀點,每天自動整理成一份日報。免費,隨時可退訂。

免費訂閱