稀疏注意力對記憶體架構的衝擊:Top-K 難解容量瓶頸與階層式 KV 快取調度
- —稀疏注意力僅在核心 Scaled Dot-Production Attention (SDPA) 運算時縮減記憶體消耗與頻寬需求,但 Top-K 選取機制通常仍需將完整上下文載入 HBM 中,因此無法消除記憶體容量瓶頸。
- —SGLang 團隊開發的 HiSparse 系統採取類似 LRU 的階層式管理機制,將 KV 快取自主機 DRAM 與 GPU HBM 間動態換入換出,並透過跨層重疊(layer-wise overlapping)掩蓋傳輸延遲。
稀疏注意力技術雖顯著優化了注意力運算的峰值頻寬與顯存佔用,但 Top-K 索引與全上下文留存本質上仍需要龐大的物理容量支援,使得 記憶體 容量瓶頸依然存在。隨著模型邁入長上下文與高並發代理應用,系統瓶頸正轉移為對主機 DRAM 與階層式儲存的傳輸調度需求。稀疏注意力並未實質降低模型對整體記憶體容量的剛性需求,反而加速推動了 GPU HBM 與主機記憶體協同的階層式架構變革