MoE 推論四階段解耦:Prefill、Midfill 與 Decode 的運算強度差異與小 Batch 經濟學
- —MoE 模型徹底改變了 Serving 架構:Prefill 具備高算術強度且無歷史 Context;Midfill 面臨大容量前綴讀取與突發路由計算;Decode Attention 算術強度極低且完全受制於私有 KV 移動;Decode Experts 雖與上下文無關但受限於專家命中機率。將各階段解耦成專屬 Worker 池可避免硬體功能閒置與管線阻塞。
AI算力 中期
MoE 推論將計算分流為 Prefill、Midfill 與 Decode 等異質負載,Decode 階段因 KV 讀取私有化而無法透過堆疊 Batch Size 獲得傳統規模效益,反而推高延遲。MoE 推論的最優操作點在於解耦各階段負載並在 Decode 端維持小 Batch 運行,以極大化高經濟價值的互動性 Token 輸出