KOL Digest
Semianalysis · 2026.09.07 週一 · Substack

TPU Inference Externalization Full Steam Ahead - InferenceX

看原始內容 4 個主題 · 9 個標的/題材

TPUv7 Ironwood vs. NVIDIA Blackwell:推論性價比與 TCO 經濟學

  • 在聚合推論(aggregated serving)與 FP8 基準下,TPUv7 憑藉較低的晶片持有成本(TCO),在多數 Interactivity 區間展現顯著性價比優勢。
  • NVIDIA GB300 NVL72 目前憑藉 Prefill-Decode (PD) 分離在部分中延遲區間領先,但隨 TPU 軟體導入 PD 分離與投機解碼,差距可望迅速收窄。
$GOOGL 中期

TPUv7 Ironwood 在 100 tok/s/user 的交互速率下每百萬 token 成本為 0.181 美元,較 $NVDA B200 低 19%、較 B300 低 34%;在 20 tok/s/user 時每晶片吞吐量達 9,364 token/s,性價比領先 B200 達 50.4%。Google 透過軟硬體共同設計與低 TCO 優勢,使 TPUv7 在推論性價比曲線上展現強大競爭力

$NVDA 中期

Blackwell 在單晶片峰值運算與原生 FP4 上仍維持技術領先,且 GB300 NVL72 藉由成熟的 PD 分離在中等延遲區間對 $GOOGL TPUv7 聚合推論保有約 30% 性價比優勢。NVIDIA 在純硬體性能與低精度運算雖具優勢,但面臨 Google TPU 顯著的 TCO 成本競爭壓力

AI算力 中期

推論市場買家的核心關注點已由純晶片算力轉向每美元產出(Performance per Dollar)與每瓦性能。雲端推論架構正進入由 TCO 驅動的多晶片方案競爭期。雲端大型模型推論的競爭重心已由峰值算力轉向每美元 Token 產出的系統級經濟效益

軟體架構重組:Native TorchTPU 取代 TorchAX 奠定開源推論生態

  • Google 過去採用的 TorchAX 轉譯層存在複雜的狀態函數化與編譯開銷,新一代 TorchTPU 將 TPU 提升為 PyTorch 原生支援裝置。
  • 與 Inferact、RadixArk 及開源社群深度合作,預計於 10 月中旬 PyTorch 大會開源,推動 vLLM 與 SGLang 實現 Day-0 支援。
$GOOGL 中期

Google 推出的 TorchTPU 基於 PyTorch PrivateUse1 機制將 TPU 作為原生設備,保留 PyTorch dispatch、eager 執行與 torch.compile 流程,並由 StableHLO/XLA 與 Pallas kernel 負責底層調度。TorchTPU 消除跨框架轉譯瓶頸,使開源模型能以原生 PyTorch 流程在 TPU 上快速適配與部署

AI算力 中期

vLLM 與 SGLang 作為主流開源推論引擎,過去主要圍繞 $NVDA CUDA 進行 Day-0 最佳化。隨 $GOOGL TorchTPU 架構原生化,TPU 的軟體適配成本將顯著下降。原生 PyTorch 支援大幅降低推論引擎跨框架遷移門檻,加速 TPU 在開源生態的普及

TPU 推論 Kernel 深度最佳化:DEP8、SparseCore 分工與記憶體重構

  • TPU 晶片架構與 GPU 不同,256x256 MXU 脈動陣列與 128-lane 向量單元對形狀與填充極為敏感,需要專屬的 Kernel 設計以充分釋放算力。
AI算力 中期

Qwen3.5 最佳化採用 DEP8(8-way DP 注意力結合 8-way EP),將 ReduceScatter 與 MoE 參差資料整理卸載至 SparseCore 以重疊 TensorCore 矩陣運算。透過運算與通訊重疊以及硬體特化核心協同,顯著降低推論延遲並提高硬體利用率

半導體 中期

TPU 記憶體調度引入 sequence-on-lane 配置消除 128-lane 填充浪費使可用 KV 頁數翻倍,並透過 compact 循環狀態分配釋放 76GiB HBM。晶片專屬幾何結構與記憶體分層管理是硬體加速器能否發揮理論頻寬的關鍵工程關鍵

硬體拓撲與推論演進藍圖:從 3D Torus 到 TPUv8i Boardfly 與 AgentX

  • TPU 叢集透過 ICI 自研互連與光線路交換器(OCS)繞過 CPU/PCIe 達成低延遲點對點通訊,Ironwood 支援高達 9,216 顆晶片超大 Pod。
  • 推論演進藍圖涵蓋多 Token 投機解碼(MTP)、Prefill-Decode (PD) 分離(TPU-Sync)以及支援 Mooncake Store 的 DRAM/NVMe P2P KV-cache offloading。
$GOOGL 長期

次世代推論晶片 TPUv8i 捨棄 3D Torus、改採高基數交換的 Boardfly 拓撲,將網路直徑自 16 hops 縮減至 7 hops,並搭載 19.2 Tb/s ICI 頻寬與 384MB on-chip SRAM。Boardfly 拓撲顯著壓低集體通訊尾端延遲,為多輪 AgentX 與長上下文推論奠定硬體護城河

AI基建 長期

多輪長上下文與 Agent 工作負載依賴極高前綴複用率與突發子代理調度,推動 KV-cache 卸載至主機 DRAM 與分散式儲存池成為標配架構。記憶體池化與低直徑網路拓撲是支撐次世代多輪 Agent 系統規模化運行的底層基石

每天早上,收件匣見

53 位中英文財經 KOL 的觀點,每天自動整理成一份日報。免費,隨時可退訂。

免費訂閱