AI 推論轉向頻寬導向:4-hi HBM 具備最佳頻寬性價比與 TCO
- —AI 算力重心由預訓練轉向推論與強化學習,解碼階段本質為記憶體頻寬受限,額外容量邊際效益遞減且承擔高額 BOM 成本
- —HBM 價格主要依容量計費,4-hi 透過完整分佈 2048 I/O 取得與高堆疊相同之峰值頻寬,提供最便宜的頻寬成本
$NVDA 中期
Rubin Ultra 將每 GPU 的 記憶體 容量由 288GB 下調至 192GB 並採用 8-hi,主因在於 N3 與 CoWoS 產能受制於 HBM 晶圓供應短缺與成本攀升。藉由轉向 NVL576 機櫃級互連,整體系統記憶體容量反而大幅躍升。NVIDIA 縮減單晶片 HBM 堆疊高度反映推論工作負載對純容量依賴降低,轉向以機櫃級架構與頻寬 TCO 為核心考量
HBM 晶圓產能極度吃緊帶動明年每 GB 成本顯著上揚,而 4-hi HBM 能以最低 BOM 成本提供與 8-hi 和 12-hi 完全相同的頻寬。在真實推論互動延遲要求下,8-hi 與 12-hi 帶來的吞吐增益遠低於系統成本增幅。推論硬體設計正迎來轉折點,4-hi HBM 憑藉最高頻寬性價比將成為次世代 ASIC 與加速器的最優配置