RDU與GPU的運算模式差異:確定性dataflow vs 核函數迴圈
- —GPU推論每步kernel計算後都需將中間結果寫回HBM再讀回,造成大量記憶體存取延遲。SambaNova RDU則由compiler預先決定所有PCU(算術引擎)與PMU(SRAM scratchpad)的連線拓撲,計算中間結果留在晶片上的PMU中不出晶片,HBM僅用於初始weights載入。SN40L有1,040個PCU + 1,040個PMU(共520MiB SRAM),SN50規模約翻倍(2,080 PCU/PMU)。可程式化交換矩陣讓compiler得以任意分配計算與記憶體資源給推論流程的各個步驟。
機架規模擴展與推論硬體競品定位
- —每台SambaChassis有8顆RDU晶片+2顆x86 CPU,每機架2台共16顆RDU,整機架可視為單一大型晶片,透過scale-up fabric任意路由datapath。機架合計約7GB SRAM、1TB HBM。相較之下Cerebras WSE每wafer有44GB SRAM,每機架2片共88GB SRAM,SRAM密度大幅領先;Nvidia Rubin NVL144每機架則有20.7TB HBM。SambaNova自評比Groq更靈活(Groq是one-trick pony)、比Cerebras更適合超大型模型(Cerebras在大型模型上有困難);與Rubin的詳細比較需在paywall後才能看到。
每天早上,收件匣見
53 位中英文財經 KOL 的觀點,每天自動整理成一份日報。免費,隨時可退訂。