TPUv7 Ironwood vs. NVIDIA Blackwell:推論性價比與 TCO 經濟學
- —在聚合推論(aggregated serving)與 FP8 基準下,TPUv7 憑藉較低的晶片持有成本(TCO),在多數 Interactivity 區間展現顯著性價比優勢。
- —NVIDIA GB300 NVL72 目前憑藉 Prefill-Decode (PD) 分離在部分中延遲區間領先,但隨 TPU 軟體導入 PD 分離與投機解碼,差距可望迅速收窄。
TPUv7 Ironwood 在 100 tok/s/user 的交互速率下每百萬 token 成本為 0.181 美元,較 $NVDA B200 低 19%、較 B300 低 34%;在 20 tok/s/user 時每晶片吞吐量達 9,364 token/s,性價比領先 B200 達 50.4%。Google 透過軟硬體共同設計與低 TCO 優勢,使 TPUv7 在推論性價比曲線上展現強大競爭力
Blackwell 在單晶片峰值運算與原生 FP4 上仍維持技術領先,且 GB300 NVL72 藉由成熟的 PD 分離在中等延遲區間對 $GOOGL TPUv7 聚合推論保有約 30% 性價比優勢。NVIDIA 在純硬體性能與低精度運算雖具優勢,但面臨 Google TPU 顯著的 TCO 成本競爭壓力
推論市場買家的核心關注點已由純晶片算力轉向每美元產出(Performance per Dollar)與每瓦性能。雲端推論架構正進入由 TCO 驅動的多晶片方案競爭期。雲端大型模型推論的競爭重心已由峰值算力轉向每美元 Token 產出的系統級經濟效益