KOL Digest
硅谷101 · 2026.07.31 週五 · YouTube

“榨”出硅的极限:怎么让GPU不“闲着”?|与SGLang、RadixArk深聊AI Infra技术与千亿美元市场

看原始內容 3 個主題 · 4 個標的/題材

AI Infra 四層架構與 GPU 空轉瓶頸:軟體優化解鎖算力極限

  • 隨著大模型競賽進入大規模部署階段,巨頭資本支出持續飆升,但 GPU 仍存在近 20% 的執行空轉能耗浪費。物理層優化週期長,而服務編排與系統軟體層優化可提供最直接的經濟回報。
$NVDA 中期

NVIDIA GB200 NVL72 等高性能機櫃硬體成本極高,若上層軟體棧未做好調度與優化,GPU 利用率可能低至 50%。將利用率從 50% 提升至 90% 以上,效果相當於憑空增加一台機櫃。硬體成本達到數百萬美元量級時,軟體層的每一次效率優化都直接轉化為商業回報

AI基建 看多 長期

AI 基礎設施產業重心正加速上移,服務編排層與推理引擎如 vLLM 和 SGLang 成為資本與前沿實驗室競相佈局的重點。透過上層軟體與服務編排的重寫優化,能以最高槓桿率提升算力利用率並降低營運成本

推理優化核心技術:KV Cache 複用、PD 分離與連續批處理

  • 智能體工作流中存在大量共享系統提示詞,SGLang 透過基數樹 RadixAttention 實現跨請求與跨機器共享前綴 KV Cache,顯著降低首 Token 延遲 (TTFT)。同時連續批處理 (Continuous Batching) 將 GPU 吞吐量提高 2 至 4 倍。
AI算力 看多 中期

大模型推理包含高計算需求的 Prefill 與高記憶體頻寬需求的 Decode 兩個階段,傳統混合執行會導致互相拖累。DeepSeek 與 NVIDIA Dynamo 等架構均轉向 PD 分離部署。Prefill 與 Decode 階段拆分至不同硬體配置並透過高速網絡傳遞中間結果,已成為大規模推理服務的標準架構

後訓練強化學習 (RL) 與 Miles 訓推一體化框架

  • 強化學習後訓練帶動模型形態變化,需要交替進行在線推理、打分評估與參數更新。RadixArk 推出 Miles 訓練框架與 SGLang 深度配合,解決了傳統框架中訓練與推理頻繁切換造成的算力浪費。
AI應用 看多 中期

強化學習將推理、評估與參數更新交替執行,要求系統在硬體與內核級保持訓推對齊。Miles 與 SGLang 聯動形成了高效的後訓練閉環。將訓練與推理置於同一系統中共同調度,能有效消除跨階段等待並促進特定場景專用模型的誕生

每天早上,收件匣見

53 位中英文財經 KOL 的觀點,每天自動整理成一份日報。免費,隨時可退訂。

免費訂閱