NVIDIA Vera Rubin NVL72 評測:AgentX 代理推論性價比達 GB300 的 67 倍
- —AgentX 基準測試揭示 Agent 推論具備多輪對話、長上下文、高前綴重用及子代理並發等特徵,極度考驗架構級協同與 KV 快取調度
- —在 170 TPS 高互動性場景下,Vera Rubin NVL72 展現出相較 Blackwell 世代達 67 倍的每美元 Token 產出優勢,且端到端延遲大幅縮減至六分之一
Vera Rubin NVL72 透過 GPU、Vera CPU、NVLink 6 等六項產品深度協同設計,在 60 至 100 TPS 的主流推論區間達成 Blackwell GB300 的 1.4 至 3 倍性價比,高互動區間優勢更達數十倍。大幅領先的推論每美元產出與租賃回報率將驅使算力買家加速轉向 Rubin 平台,進一步鞏固資料中心市場定價權與獲利能力
在 DeepSeek V4 Pro 代理工作負載評測中,$AMD MI355X 於 100 TPS 下的每百萬瓦 Token 吞吐量僅為 2.01 百萬,落後 $NVDA Vera Rubin 達 29.5 倍。在次世代代理推論與高階叢集架構上,MI355X 的能效與每美元產出面臨巨大的競爭劣勢
AI 工作負載正由單輪對話轉移至複雜的 Agent 代理系統,對高並發、長上下文與低延遲的要求促使算力平台從單晶片過渡至全機櫃深度協同架構。全機櫃協同設計的推論加速架構已成次世代 AI 算力降低單位 Token 成本的核心分水嶺