近期觀點
在 DeepSeek-V4.1-Flash 的 AgentX 推論測試中,得益於與開源社群及 vLLM 維護者的深度協同,NVIDIA 全系列 6 款 GPU 於 Day 0 即達成開箱即用與極限優化。即便考慮對手較低的硬體採購成本,B200 與 B300 的每美元 Token 產出仍展現壓倒性優勢。CUDA 護城河源於數百萬開發者生態與推論引擎的即時深度適配,使 NVIDIA 在次世代模型推論服務中持續享有統治級優勢
儘管標榜以速度為護城河,AMD 在 DeepSeek-V4.1-Flash 發布首日未能即時釋出 vLLM 容器鏡像,初版效能每美元產出更大幅落後 $NVDA。即使在模型發布第 7 天進行顯著優化,MI355X 在計入 TCO 後的性價比仍比 B200 差 2 至 4 倍。開源軟體生態與推論引擎適配的執行力落差,嚴重削弱了 AMD 加速器在次世代推論工作負載中的硬體性價比競爭力
Vera Rubin NVL72 透過 GPU、Vera CPU、NVLink 6 等六項產品深度協同設計,在 60 至 100 TPS 的主流推論區間達成 Blackwell GB300 的 1.4 至 3 倍性價比,高互動區間優勢更達數十倍。大幅領先的推論每美元產出與租賃回報率將驅使算力買家加速轉向 Rubin 平台,進一步鞏固資料中心市場定價權與獲利能力
以 DeepSeek V4 Pro 規模模型測算,Vera Rubin 每吉瓦電力每年可產生 1,595 億美元營收與 1,499 億美元獲利,較 GB300 增加 446 億美元獲利與 42% 增幅。在電力受限的資料中心環境中,Rubin 展現的極致能效優勢將使算力營運商享有更充裕的降價競爭空間與超額利潤
在 DeepSeek V4 Pro 代理工作負載評測中,$AMD MI355X 於 100 TPS 下的每百萬瓦 Token 吞吐量僅為 2.01 百萬,落後 $NVDA Vera Rubin 達 29.5 倍。在次世代代理推論與高階叢集架構上,MI355X 的能效與每美元產出面臨巨大的競爭劣勢
表外擔保升至 5,300 億美元但遠小於未來數千億美元 EBITDA 與累積現金生成能力,且享有不對稱風險回報:景氣好賺取 GPU 滿額毛利與超額分潤,景氣差則有最低保底維持租戶償債。龐大自由現金流提供極厚防波堤,具備充分空間與意願持續擴張表外擔保以支撐 AI基建 擴張
受惠於氣渦輪機交期過長與極為嚴苛的空污審批,固態氧化物燃料電池成為大型 AI 表後專案的關鍵替代方案,已獲 $GOOGL 900MW 與 Nebius 328MW 等大型合約採用。其電化學發電具備極低氮氧化物排放與標準化審批優勢,且採垂直整合安裝運維。燃料電池憑藉極低排放與規避繁複空污審批的優勢,正迅速在 GW 等級 AI 資料中心微電網中擴大市佔份額
超級雲端大廠紛紛自研 XPU 侵蝕 GPU 利潤,NVIDIA 亟需多元開源與主權 AI 客戶以避免客戶過度集中於少數雲端巨頭。透過 5,000 億美元基建融資聯盟及各國主權算力採購,NVIDIA 藉由開源生態商品化互補品,成功將主權 AI 轉化為長期算力需求與資本綁定的新增長引擎
韓國雖重金投資資料中心,但缺乏具競爭力的本土加速器生態,在 2GW 算力部署中高度依賴 $NVDA Vera Rubin 架構。NVIDIA 藉此擴大對其主要記憶體夥伴的談判籌碼,傳已鎖定 2027 年 HBM4 優惠定價與 SOCAMM 長約。主權算力擴張加深對單一晶片巨頭依賴,SK 海力士恐被迫在 HBM 定價與利潤空間上讓步
攜手 OpenAI 僅用 16 個月即完成通用推論 ASIC 之設計與 tape-out,展現業界頂尖的客製化晶片執行力。相較 $NVDA 高毛利定價,$AVGO 較低之設計代工毛利幫助客戶顯著降低每代幣 TCO。OpenAI 自研晶片的成功交付證明了 Broadcom 在客製化 ASIC 領域的強大執行力與市佔領先地位
GB300 與 B300 憑藉增加 50% 的 HBM 容量與 Dynamo / TRT-LLM 優化,在 DeepSeek V4 與 MiniMax M3 的 Agentic 推論表現出色。雖然在部分單點被 $AMD 特化引擎追上,但完整的軟體生態與 Context Parallelism 仍構築極高護城河。HBM 容量優勢搭配完善的推論生態系,使 NVIDIA 在多輪長文本推論成本效率上維持絕對領先
MI355X 搭配專有 ATOM 引擎在 DeepSeek V4 與 Kimi K3 表現亮眼,部分延遲區間性價比超越 $NVDA GB300。然而開源 vLLM 與 SGLang 的適配度依然嚴重落後,且客戶不願在生產環境採用專有 ATOM。硬體規格具備競爭力但開源軟體生態落後,需加速將 ATOM 優化上游化至 vLLM 才能轉化為商業訂單
傳統 GPU 架構因 CUDA Kernel 啟動開銷與記憶體延遲,在超低延遲推論場景無法達到 HBM 理論頻寬。TileRT 透過將 Decode 計算靜態編譯為單一持久化 Kernel,在 $NVDA B200 節點達成高達 500 tok/s/user 的互動速度,比同等精度的傳統引擎快 3 倍。TileRT 解決了 NVIDIA GPU 缺乏超低延遲優勢的短板,使其硬體生態系在低延遲與高吞吐市場同時保持領先
Groq 與 Cerebras 原本憑藉片上 SRAM 壟斷超低延遲推論市場,但 TileRT 讓現有 $NVDA GPU 叢集只需更新軟體配置即可達成極致互動速度。通用 GPU 的軟體彈性避免了專用 ASIC 硬體比例固定導致的資本閒置風險。TileRT 顯著降低了客戶採購專用推論 ASIC 的必要性,鞏固了 NVIDIA 通用 GPU 叢集的總體有效市場(TAM)
Episodes
53 位中英文財經 KOL 的觀點,每天自動整理成一份日報。免費,隨時可退訂。