KOL Digest
Semianalysis · 2026.09.23 週三 · Substack

ClusterMAX 3.0: The Industry Standard GPU Cloud Rating System Returns

看原始內容 5 個主題 · 13 個標的/題材

ClusterMAX 3.0 評級出爐:Nebius 晉升白金,前沿巨頭裸金屬與新創代管雲兩極分化

  • —代管 GPU 叢集市場呈現雙向分化,OpenAI 與 Anthropic 等前沿實驗室預計至 2027 年底將囊括 56.3% 的實驗室算力,傾向跳過代管層直接採購裸金屬並自管 Kubernetes 控制面;中小型新創與開源模型推論則支撐起龐大的代管長尾市場。
$ORCL 中期

$ORCL 穩居黃金級評級,近期交付高達 850MW 機房容量並深度綁定 OpenAI Stargate 計畫,預計 2027 年將是超大規模雲端中相對增速最快者。其 GB300 叢集在多平面網路與 Lustre 儲存表現優異,但控制台仍缺乏企業級 RBAC 權限管理。甲骨文在超大合約與物理拓撲具備領先優勢,但其成長高度繫於前沿巨頭合約與基礎管線許可交付進度。

$GOOGL 中期

$GOOGL 旗下 GCP 升入黃金級,積極拓展外部算力租賃與 TPU 銷售,並與 Blackstone 簽署 500MW 的 TPU 雲合作協議。GKE 在 GPU 節點管理及自動化 ConnectX 網路優化大幅改善,但控制台體驗繁瑣且 mid-market 供貨定價仍具劣勢。Google 兼具全棧工程實力與龐大電力管線,正藉由 TPUaaS 與開源 NCCL 外掛自動化重新奪回 GPU 雲端市場份額。

AI算力 ↑看多 長期

全球僅 19 家雲端廠商達到獎牌級別,CoreWeave 與 Nebius 憑藉深厚工程積累與定價權位居白金級,微軟 $MSFT 與亞馬遜 $AMZN 則因可靠性或架構繁複分別落入白銀與青銅級。代管叢集並未隨前沿巨頭自建而萎縮,反而受開源模型推論與新創融資驅動而持續爆發。整體代管 GPU 算力仍處於高定價權的賣方市場,供應端任何瓶頸都將使具備高可靠性與自動化維運能力的優質雲端商持續享有溢價。

AI 基建融資結構轉向:NVIDIA 資產負債表即服務與多方交易對手風險

  • —算力租賃融資進入重度依賴承購方(offtaker)信用評級的階段,缺乏一線客戶合約的 Neocloud 融資成本高昂,促使針對合約提前終止的參數型保險應運而生;同時產業面臨多重貸款綁定同一客戶的連鎖交易對手風險。
$NVDA 長期

$NVDA 透過 AICP 提供最低營收保底、地主擔保與轉租承諾,直接將自身的資產負債表轉化為服務,協助新興雲端商取得投資級債務融資。此舉不僅在硬體首發時鎖定晶片高額毛利,還能在雲端營收超越保底底價時參與分成。輝達透過資產負債表支援與保底協議直接打通下游客戶的融資鏈條,將充沛資本轉化為拉動自家算力需求的強大金融護城河。

AI基建 ↑看多 長期

市場對 GB300 與次世代伺服器的 6 年折舊假設缺乏二手殘值定價能力支撐,貸款償還期與會計折舊脫節導致放款機構審核趨嚴。然而超大規模算力擴建仍獲華爾街債務與資本市場大舉注資,前沿巨頭數百億美元級別的算力合約持續推升基建動能。以投資級客戶合約質押與硬體收益保底為核心的金融工程正重塑 AI 基建擴張節奏,確保大規模資本開支具備持續閉環能力。

Blackwell 液冷機櫃維運典範轉移:NVL64+ 規範成形與 Vera Rubin 超前交付

  • —從 HGX 8 卡伺服器轉向 GB300 NVL72 帶來全方位工程衝擊,涵蓋 Grace ARM 架構、強制 DLC 直接液冷、130kW 以上高壓供電、800G CX-8 網路及 72 顆 GPU 的 NVLink 背板互連。各家廠商的電氣冷卻工程能力面臨嚴苛考驗。
$NVDA 中期

$NVDA 次世代 Vera Rubin (VR NVL72) 承襲 ARM 處理器、液冷機櫃與 72 路 NVLink 背板,軟體遷移門檻遠低於 Hopper 至 Blackwell 的跨度。核心變更在於升級至 1.6T CX-9 網卡、單櫃功率攀升至 200kW 及 800V DC 直流供電。次世代 Vera Rubin 架構的高延續性與成熟度促使各雲端廠商系統建置顯著順暢,交付進度普遍超前預期。

伺服器 ↑看多 中期

NVL72 機櫃內無法如傳統 HGX 單點熱插拔備援節點,單一托盤故障即波及 4 顆 GPU,促使業界廣泛採用「NVL64+」的 SLA 協議,即 18 個節點中有 3 個故障即判定全櫃停機。液冷機櫃式伺服器的故障隔離機制大幅拉高了雲端業者的日常運維門檻,具備自研冷卻迴路監控與優化備援調度的供應商更具生存空間。

散熱 ↑看多 長期

GB300 NVL72 全面導入強制 DLC 直接液冷與單櫃 130kW 供電,CoreWeave 等領先業者甚至自行研發可程式化單櫃液冷閥門 Valvey 以實現精準流體控制與漏液自動斷電。機房設施運維已與電腦系統緊密結合,機櫃級液冷與高壓電力調度技術已成為次世代 AI 算力部署不可或缺的物理瓶頸與價值重心。

橫向擴展網路瓶頸:800G 多平面洗牌架構與 Oracle MRC 13 萬卡拓撲

  • —Scale-out 網路是雲端廠商目前少數能自主掌控的硬體架構環節。800G CX-8 網卡多採用 Multiplanar 架構將頻寬拆分至獨立交換平面,需透過洗牌箱或洗牌線束精準對齊平面。
$ORCL 長期

$ORCL 於 GB300 叢集採用 Acceleron 多平面網路,其 MRC 拓撲透過 8x100G 拆分將 51.2T 交換器擴展為 512 埠,僅用 2 層交換架構與最多 3 跳即可支援 131,072 顆 GPU 全頻寬無收斂互連。搭配 SRv6 來源路由與選擇性 ACK 實現多路徑封包噴射。甲骨文 MRC 拓撲在物理洗牌與超大規模連網軟體調度取得重大突破,為十萬卡等級巨型運算叢集立下互連標竿。

$AMD 中期

$AMD MI355X 雖然在硬體規格上具備競爭力,但在實際雲端測試中遭遇嚴峻的軟體與網路瓶頸。其配套的 ionic 網卡驅動在 RDMA 高壓測試下容易出現卡死且無法被健康檢查即時捕捉,RCCL 在特定封包大小下甚至出現停滯。超微在 GPU 運算單元已顯著縮小與對手差距,但網路通訊協定棧與底層驅動的穩定性仍落後於輝達生態系。

網通 ↑看多 中期

多節點 NVLink 的 ComputeDomain CRD 與 RDMA 整合極具挑戰,跨機櫃未正確隔離將導致通訊鎖死。Google $GOOGL 藉由整合 ConnectX gIB NCCL 外掛在 16 節點 All-to-All 跑出 99.5 GB/s 全線速頻寬,相較之下亞馬遜 $AMZN 的 EFA 網路對 DeepEP 等新通訊原語支援不足。橫向擴展網路的驅動調校與外掛最佳化直接決定分散式訓練的通訊有效帶寬,成為衡量雲端叢集硬實力的關鍵指標。

集群可靠性自動修復與 Coding Agent 崛起:自建腳本壓縮純代管雲溢價

  • —叢集健康檢查與故障自癒(Autoremediation)直接決定可用算力產出(Goodput),NVIDIA 開源 NVSentinel 協助將 172 種 XID 錯誤對應到重啟或排空等 SOP,避免無效重啟破壞正常訓練作業。
AI應用 ↑看多 長期

工程團隊廣泛藉由 Codex 與 Claude 等 Coding Agent 於夜間自主除錯、撰寫配置腳本與修復集群障礙。AI 代理工具顯著降低了工程師排解底層 Linux 與 Kubernetes 配置的難度,促使部分團隊更傾向選擇廉價裸金屬。代碼代理工具大幅抹平了基礎環境除錯的技術差距,使得缺乏深層自研軟體能力的輕度代管雲面臨定價權受侵蝕的壓力。

軟體股 ↑看多 中期

面對 Agent 工具對基礎代管服務的衝擊,頂級雲端商如 CoreWeave 開發 Fleet LifeCycle Controller 與 NodeBot,結合全集群遙測大數據與大語言模型進行非典型軟性故障與掉隊節點診斷。具備專屬數據迴圈與自動化診斷專利的深度系統軟體才能建立防禦性壁壘,單純販售通用管理面板的雲端服務將逐步邊緣化。

每天早上,收件匣見

53 位中英文財經 KOL 的觀點,每天自動整理成一份日報。免費,隨時可退訂。

免費訂閱