TPUv7 推論性價比突破與開源生態原生化:TCO 競爭重塑 AI 晶片格局
- —在 FP8 聚合推論基準下,Google TPUv7 憑藉較低晶片持有成本(TCO),推論性價比較 NVIDIA B200 提升最高達 50%、較 B300 提升達 96%,雲端推論市場競爭焦點正式由純峰值算力轉向每美元 Token 產出
- —Google 推出 Native TorchTPU 替代過去的 TorchAX 轉譯架構,將 TPU 提升為 PyTorch 原生裝置,預計 10 月開源並推動主流推論引擎 vLLM 與 SGLang 實現 Day-0 支援,大幅降低開源模型跨框架遷移門檻
- —推論專用晶片 TPUv8i 改採高基數交換的 Boardfly 拓撲,將網路直徑自 16 躍點(hops)縮減至 7 躍點,搭配 DEP8 注意力並行與 SparseCore 卸載,為多輪 Agent 與長上下文推論奠定硬體護城河
- —NVIDIA A100 因推論租賃需求旺盛使租金收入完全抵銷折舊並鎖定長約至 2029 年,證實 AI 算力硬體使用年限高於會計準則,但算力龍頭以股權投資與未售容量兜底綁定 Neocloud 亦伴隨產業集中度風險