人工智慧晶片龍頭輝達17日公布首次 MLPerf Inference 預覽測試結果中,NVIDIA Vera Rubin NVL72 的輸送量較 GB300 NVL72 提升高達 3.7 倍。
一項橫跨四座 GB300 NVL72 機架、共使用 288 顆GPU的測試配置,達成 99% 的擴展效率,其輸送量相較單一機架基準近乎呈現線性成長。而NVIDIA 在 MLPerf Inference v6.1 提交結果中的軟體最佳化,相較於 v6.0 版本,效能最高提升 1.6 倍。v6.1 提交截止後,最佳化工作仍持續進行,進一步帶來效能提升。
這項效能代表每座 Vera Rubin NVL72 機架所產生的詞元數量、服務的使用者數量,以及創造的營收,均遠高於 GB300 NVL72 機架,同時還能降低每詞元token成本。

這些成果反映硬體與軟體的全端協同設計。Vera Rubin 增強的 Tensor Core 與 Transformer Engine 可加速推論的預填充與解碼階段,而 NVFP4 精度則能降低模型權重、注意力與 KV 快取的記憶體占用量,在幾乎不犧牲輸出品質的情況下提高輸送量。
Vera Rubin 提交結果大量採用分離式服務,將預填充與解碼分開處理,並搭配大規模專家平行化,讓驅動 DeepSeek-R1 與 Qwen3-VL 等模型的混合專家層達到最高效率。
NVL72 垂直擴展網域採用第六代 NVIDIA NVLink 與 NVLink Switch,相較現成乙太網路可提供高達 10 倍的封包速率,並將延遲降低 3 倍,建立互連基礎,讓這些技術能在機架規模下有效運作。
這項協同設計更延伸至 NVIDIA 合作夥伴生態系。Nebius 同樣提交 Vera Rubin NVL72 預覽測試結果,並展現出卓越的效能。
能夠進行多步驟推理、規劃與行動的 AI 代理,正在重塑推論效能的衡量方式。在 SemiAnalysis AgentX 等旨在反映這項轉變的基準測試中,Vera Rubin NVL72 於預覽測試的效能達 GB300 NVL72 的 30 倍。此外,即將推出的 MLPerf Endpoints 基準測試將為代理型推論工作負載帶來標準化的衡量方式,涵蓋傳統輸送量基準測試未能反映的面向。