KOL Digest
Semianalysis · 2026.09.28 週一 · Substack

How GLM5.3 Sparse Attention Affects HBM Memory Usage

看原始內容 4 個主題 · 8 個標的/題材

稀疏注意力對記憶體架構的衝擊:Top-K 難解容量瓶頸與階層式 KV 快取調度

  • —稀疏注意力僅在核心 Scaled Dot-Production Attention (SDPA) 運算時縮減記憶體消耗與頻寬需求,但 Top-K 選取機制通常仍需將完整上下文載入 HBM 中,因此無法消除記憶體容量瓶頸。
  • —SGLang 團隊開發的 HiSparse 系統採取類似 LRU 的階層式管理機制,將 KV 快取自主機 DRAM 與 GPU HBM 間動態換入換出,並透過跨層重疊(layer-wise overlapping)掩蓋傳輸延遲。
記憶體 ↑看多 長期

稀疏注意力技術雖顯著優化了注意力運算的峰值頻寬與顯存佔用,但 Top-K 索引與全上下文留存本質上仍需要龐大的物理容量支援,使得 記憶體 容量瓶頸依然存在。隨著模型邁入長上下文與高並發代理應用,系統瓶頸正轉移為對主機 DRAM 與階層式儲存的傳輸調度需求。稀疏注意力並未實質降低模型對整體記憶體容量的剛性需求,反而加速推動了 GPU HBM 與主機記憶體協同的階層式架構變革

AI算力 ↑看多 中期

面對稀疏注意力帶來的記憶體容量壁壘,單純依賴晶片內顯存已不足以支撐高吞吐長序列推論,結合跨層重疊預取的階層式調度成為算力擴展的核心路徑。透過在層間無縫換入換出 KV 快取,推論系統得以在有限硬體下實現顯著吞吐倍增。系統級記憶體優化與硬體協同架構已成為決定稀疏注意力模型實際推論算力效率的關鍵瓶頸

GLM-5.3 代理推論性價比評測:$NVDA Blackwell 對決 $AMD MI355X 之成本與延遲權衡

  • —在 InferenceX 基準測試中,GB300 在 150 TPS 目標下展現最低建模服務成本,每 GPU 吞吐量較 GB200 提升 17.5%,但每小時 2.31 美元對比 1.86 美元的租用成本抵消了部分吞吐優勢。
  • —在並發數由 8 升至 16 的長程代理負載下,GPU 顯存的 Prompt 重用率自 90.3% 降至 54.8%,大量重用轉向主機 記憶體(由 6.0% 升至 40.3%),使整體快取命中率維持在 95% 以上。
  • —TileRT 推論引擎將解碼編譯為單一持久化核心,在 AMD MI355X 上運行 FP8 時展現出較最佳 FP4 配置高出 2 倍的 P90 互動速度,較 GB300 NVL72 亦有 40% 的速度優勢,但首字延遲仍有優化空間。
$NVDA 中期

在 150 TPS 速度下,$NVDA GB200 每百萬總 Token 成本約 0.044 美元,較 $AMD MI355X 低約 12%,純輸出 Token 成本每百萬 5.92 美元亦具 11% 優勢;但在首字延遲(p90 TTFT)上 GB200 落在 14 至 19 秒,遠高於競品的 1.2 秒水準。若將首字延遲放寬至 10 秒,GB300 搭配 Dynamo-TRT-LLM 成本可降至 0.0451 美元。輝達 Blackwell 架構在純吞吐量與長串流輸出展現極高性價比,但在極致低延遲代理場景仍需承受首字等待時間較長的取捨

$AMD 中期

$AMD MI355X 搭配 ATOM 引擎在 100 TPS 下成本較 $NVDA GB200 低 13%,且首字延遲僅約 1.1 至 1.2 秒。當限制首字延遲於 2 秒以內時,MI355X 每百萬 Token 成本為 0.0607 美元,較 B200 便宜約 9%;此外 TileRT 單一持久化核心在 FP8 下使 MI355X 互動速度提升 40% 並超越 GB300 NVL72。超微晶片在低首字延遲與特定交互場景展現強勁的即時反應性優勢,惟在整體服務速度區間缺乏一致性的全面成本領先

AI算力 ↑看多 中期

代理推論架構正迅速由單純拼峰值吞吐走向即時互動性與首字延遲的多維度平衡,不同硬體架構與軟體編譯器展現出鮮明的細分市場分工。無論是 vLLM 的 CUDA graph 解碼優化使 TPOT 降至 22ms,或 ATOM 分塊預取大幅壓低延遲,軟硬體深度融合持續拓展單卡能效極限。代理推論市場的競爭重心已從單純每秒 Token 數轉移為兼顧首字延遲與長上下文歷史重用的綜合系統效率

DeepSeek 稀疏注意力演進:GLM-5 架構算力強度匹配與 IndexShare 降本

  • —GLM-5 採用 744B 總參、40B 啟動參數的 MoE 架構,導入包含輕量索引器(Lightning Indexer)與稀疏多頭潛在注意力(Sparse MLA)的 DeepSeek 稀疏注意力機制。
  • —輕量索引器省略 Value 向量與 Softmax 正規化,透過降維投影與 ReLU 計算查詢-鍵值點積,再由所有查詢頭加權求和得出索引分數以選取 Top-K Token。
  • —在 GLM-5.2 中提出的 IndexShare 機制使每 4 個稀疏注意力層共用 1 個索引器,藉由訓練目標對齊平均注意力分佈,並在推論端額外快取 Top-K 索引值,成功減少 75% 的索引器顯存開銷與 FLOPs,帶來 1.5 至 1.8 倍的吞吐量提升。
AI算力 ↑看多 中期

DeepSeek 稀疏注意力機制透過輕量索引器與 MLA 模式切換突破了長文本注意力運算的瓶頸,在短序列使用 MHA 模式而在長序列切換至 MQA 模式以降低 記憶體 加載壓力。GLM-5.2 的 IndexShare 更證明了跨層共享索引資訊能在極低精度損失下大幅釋放算力。稀疏注意力層級共享與演算法剪裁已證明能同時削減四分之三的運算負擔並維持頂級模型的長序列表徵能力

半導體 中期

GLM-5 的 MLA 配置將查詢頭數由 DeepSeek V3.2 的 128 減半至 64,使運算強度降至 120.8 FLOP/B,精確吻合摩爾線程 MTT S4000 的 128 FLOP/B 頂峰山脊線,與 DeepSeek 瞄準 H800 的 258 FLOP/B 形成鮮明對比。這印證了中國前沿大模型在架構層面主動向自主國產硬體規格收斂的趨勢。前沿模型底層注意力結構對國產算力晶片硬體特性的深度客製化,展現了軟硬協同突破先進算力封鎖的戰略方向

長長程代理後訓練演算法與系統工程:單軌異步優化 SAO 與 Slime 叢集調度

  • —GLM-5 後訓練流程歷經 SFT、三階段強化學習(推理 RL、代理 RL、通用 RL)及同策跨階段蒸餾,在 GLM-5.2 進一步升級為標準的多教師同策蒸餾(MOPD)並在兩天內融合超過十個專家模型。
  • —同步 RL 階段採用去除 KL 正則項、導入 IcePop 標記遮蔽與 Clip-Higher 裁切的改良 GRPO;異步 RL 階段則採用類似 REINFORCE 的直接雙側重要性採樣(DIS)以推論策略計算採樣比。
  • —後訓練基礎設施基於開源的 slime 框架,具備支援千路並發的 伺服器 級多任務軌跡協調器,並在 MOPD 過程中藉由 TensorBackuper 於 CPU 與 GPU 間高速置換教師模型權重。
AI基建 ↑看多 中期

在長長程代理訓練中,長軌跡的高變異與長尾延遲嚴重削弱了傳統 GRPO 的訓練穩定性,Z.ai 提出之單軌異步優化(SAO)改以 Generalized Advantage Estimation (GAE) 搭配獨立價值模型,在優化目標中剔除工具呼叫等環境觀察 Token。針對長程代理任務打造的單軌異步優化與微服務化調度系統,已成為支撐次世代複雜代理模型穩定收斂的核心基建技術

每天早上,收件匣見

53 位中英文財經 KOL 的觀點,每天自動整理成一份日報。免費,隨時可退訂。

免費訂閱