KOL Digest
Semianalysis · 2026.09.13 週日 · Substack

Long Live the Short King: Why 4-hi HBM Wins

看原始內容 2 個主題 · 5 個標的/題材

AI 推論轉向頻寬導向:4-hi HBM 具備最佳頻寬性價比與 TCO

  • —AI 算力重心由預訓練轉向推論與強化學習,解碼階段本質為記憶體頻寬受限,額外容量邊際效益遞減且承擔高額 BOM 成本
  • —HBM 價格主要依容量計費,4-hi 透過完整分佈 2048 I/O 取得與高堆疊相同之峰值頻寬,提供最便宜的頻寬成本
$NVDA 中期

Rubin Ultra 將每 GPU 的 記憶體 容量由 288GB 下調至 192GB 並採用 8-hi,主因在於 N3 與 CoWoS 產能受制於 HBM 晶圓供應短缺與成本攀升。藉由轉向 NVL576 機櫃級互連,整體系統記憶體容量反而大幅躍升。NVIDIA 縮減單晶片 HBM 堆疊高度反映推論工作負載對純容量依賴降低,轉向以機櫃級架構與頻寬 TCO 為核心考量

記憶體 ↑看多 中期

HBM 晶圓產能極度吃緊帶動明年每 GB 成本顯著上揚,而 4-hi HBM 能以最低 BOM 成本提供與 8-hi 和 12-hi 完全相同的頻寬。在真實推論互動延遲要求下,8-hi 與 12-hi 帶來的吞吐增益遠低於系統成本增幅。推論硬體設計正迎來轉折點,4-hi HBM 憑藉最高頻寬性價比將成為次世代 ASIC 與加速器的最優配置

AI算力 中期

推論解碼每生成一個 Token 均須讀取全部模型權重與 KVCache,記憶體頻寬直接決定互動速度。在 $NVDA Rubin Ultra 等系統上,過高容量若缺乏對應頻寬將淪為閒置超額配置。次世代 AI 算力架構正由追求單晶片大容量轉向最大化每單位頻寬的 Token 產出效率

機櫃級擴充與 KVCache 卸載緩解容量壓力,4-hi 最大化晶圓產出

  • —GB300 NVL72 與 Rubin Ultra NVL576 將擴展域擴大數倍,配合 MXFP4 量化使大模型權重僅佔系統總 HBM 極小比例
  • —實測顯示將非活躍 KVCache 卸載至 DDR DRAM 可在維持吞吐下大幅節省 HBM,DeepSeek 等演算法架構更大幅縮減快取需求
記憶體 ↑看多 長期

HBM 晶圓消耗是當前全球 DRAM 產能短缺的核心根源,而 4-hi 堆疊能從每片晶圓收穫相較 8-hi 翻倍、相較 12-hi 三倍的頻寬。此舉大幅提升封裝良率並緩解 伺服器 標準 DRAM 產能排擠。走向 4-hi 能將 半導體 瓶頸從 HBM 晶圓釋放並最大化每片晶圓的 Token 產出,為雲端業者與記憶體原廠創造雙贏

先進封裝 中期

4-hi 堆疊不僅大幅降低 CoWoS 封裝難度與缺陷率,更能加速晶圓產出與模組整合效率。隨著單晶片記憶體容量需求被機櫃級高速互連化解,封裝重心由極限堆疊高度轉向互連擴展。先進封裝 走向較矮堆疊有助於提升整體製造良率並加速大規模機櫃叢集之量產交付

每天早上,收件匣見

53 位中英文財經 KOL 的觀點,每天自動整理成一份日報。免費,隨時可退訂。

免費訂閱