RL 訓練系統的效率框架與吞吐量匹配
- —RL 訓練系統可視為生產者-消費者模型,Generator 生產 rollout 進入隊列,Trainer 從中消費。
- —系統效率指標包含 Training step time、FLOP/s per GPU 及 MFU,受限於推理吞吐量與沙盒延遲。
- —理想系統應使 Trainer 消費率大致等於有效 Generator 生產率,以最小化閒置時間與策略陳舊度
AI算力 長期
RL 訓練需求呈現 log-linear 擴展特性,對算力效率的要求極高。系統效率決定了模型能力的上限,透過吞吐量匹配框架可優化昂貴的 H200/GB300 資源利用率