KOL Digest
Semianalysis · 2026.09.21 週一 · Substack

Computation and Data Movement for Inference

看原始內容 3 個主題 · 4 個標的/題材

MoE 推論四階段解耦:Prefill、Midfill 與 Decode 的運算強度差異與小 Batch 經濟學

  • —MoE 模型徹底改變了 Serving 架構:Prefill 具備高算術強度且無歷史 Context;Midfill 面臨大容量前綴讀取與突發路由計算;Decode Attention 算術強度極低且完全受制於私有 KV 移動;Decode Experts 雖與上下文無關但受限於專家命中機率。將各階段解耦成專屬 Worker 池可避免硬體功能閒置與管線阻塞。
AI算力 中期

MoE 推論將計算分流為 Prefill、Midfill 與 Decode 等異質負載,Decode 階段因 KV 讀取私有化而無法透過堆疊 Batch Size 獲得傳統規模效益,反而推高延遲。MoE 推論的最優操作點在於解耦各階段負載並在 Decode 端維持小 Batch 運行,以極大化高經濟價值的互動性 Token 輸出

記憶體層級與 KV Cache 經濟學:頻寬變現優先於容量過剩,HBM 嚴格限制為熱工作層

  • —可重用的 KV Cache 在資料中心規模下本質上是不可變的 Blob 物件儲存。加速器上的 HBM 成本昂貴且供應受限,不應作為被動儲存介質;活躍前綴進入 HBM 參與運算後應迅速將非活躍狀態排出至 CPU DRAM 或平行 SSD 儲存,僅讓產生營收的活躍 Batch 佔用 HBM。
  • —隨著管線並行度(Pipeline Parallelism)加深,權重被切分但每個 Stage 仍須承載多個並行串流的 KV 狀態,當單 Stage 權重降至與 KV 狀態同量級時,進一步加深管線將不再帶來記憶體效益,形成容量交會點限制。
記憶體 中期

資料只有在移動時才能創造營收,坐落在記憶體中閒置只會產生持有成本,前沿模型每卡峰值 HBM 佔用實測多低於 80GB,過度追求單卡 HBM 容量反成沉沒成本。長 Context 推論架構的硬體核心在於高頻寬而非盲目追求大容量,高頻寬 3D RAM 與 Hybrid-bonded DRAM 將是決定能效的關鍵

硬體拓撲與叢集排程:Blackwell GB200 NVL72 機櫃級 Scale-up 網路與延遲前沿優勢

  • —並行策略必須契合模型資料流:Pipeline Parallelism 處理縱向層堆疊,Tensor Parallelism 處理不可分的寬注意力運算,Expert Parallelism 處理無上下文的專家分配。高頻且敏感的 Attention 歸約與 Expert All-to-all 必須嚴格收斂在 Scale-up 網域內,而較窄的活化值與被攤銷的 KV Blob 才能跨越 Scale-out 弱網。
  • —在 Kimi K3 模擬中,GB200 NVL72 展現全機櫃 Scale-up 頻寬優勢,可讓機櫃內所有 GPU 協同參與單層計算而無需切換至慢速跨節點網路;相較之下 B200 與 B300 必須將專家並行限制於節點內並依賴 PP=4 以避免 Scale-out 壅塞。
$NVDA 中期

$NVDA GB200 NVL72 在 Decode 與 Midfill 的低延遲與低 TTFT 前沿展現極佳架構適應性,而 B200 與 B300 則需仰賴管線並行將專家 All-to-all 限制在單節點內以防頻寬雪崩。GB200 NVL72 藉由機櫃級全域 NVLink 將高通量專家路由完全收斂在 Scale-up 網域內,確立了在大規模長上下文推論上的系統級拓撲優勢

AI基建 中期

解耦推論叢集若缺乏平滑准入控制與 Ready Buffer,Decode 延遲將向上游 Input-fill 傳遞並放大為全叢集產能振盪。推論叢集的穩定運行依賴將微秒級硬體運算與秒級排程調度分層隔離,透過機櫃級 Scale-up 網域結合彈性儲存層以維持穩態吞吐

每天早上,收件匣見

53 位中英文財經 KOL 的觀點,每天自動整理成一份日報。免費,隨時可退訂。

免費訂閱