輝達Vera Rubin主打AI代理 吞吐量較Blackwell提升30倍、Token成本降35倍
記者黃仁杰/編譯
輝達(NVIDIA)公布Vera Rubin平台最新AI代理實測結果,顯示在代理式AI推論工作負載下,Vera Rubin NVL72的吞吐量大幅超越Grace Blackwell NVL72,同時進一步降低Token運算成本,鎖定未來大規模AI代理工具部署需求。

此次測試由輝達使用真實的Agentic Coding工作流程進行,採用SemiAnalysis AgentX基準測試,評估Vera Rubin等AI基礎設施執行代理式程式設計推論的表現,測試模型包括Kimi K3、MiniMax M3、GLM5.3、Qwen3.5及DeepSeek V4 Pro。
Blackwell每MW吞吐量最高較Hopper提升80倍
在Blackwell平台方面,GB300 NVL72「Grace Blackwell」伺服器執行DeepSeek V4 Pro 1.6T時,每MW功率可提供的吞吐量,是H200 NVL8「Hopper」方案的15倍。
輝達表示,這代表在相同電力預算下,Blackwell能維持更高且反應更快的AI代理推論吞吐量。
成本方面,Blackwell每百萬Token的成本則比前一代降低10倍,使AI營運商能在相同電力與基礎設施預算下部署更多AI Agent,或以更低營運成本提供相同運算能力。
當模型規模進一步放大至Kimi K3 2.8T時,Blackwell相較Hopper的每MW吞吐量甚至提升80倍,同時能維持每位使用者每秒215個Token的互動速度。
「AI履歷健檢」看見自己優勢:https://campaign.1111.com.tw/resume-review/
更多科技工作請上科技專區:https://techplus.1111.com.tw/
Vera Rubin吞吐量再比Blackwell高30倍
進入Vera Rubin世代後,效能差距進一步拉大。
根據輝達測試,Vera Rubin NVL72在DeepSeek V4 Pro 1.6T工作負載下,吞吐量較Grace Blackwell NVL72提高30倍。
在互動效能方面,Vera Rubin約可維持每位使用者每秒160個Token,最高更可達約280 TPS;相比之下,Blackwell峰值低於每位使用者每秒180個Token。
每百萬Token成本最高降低35倍
除了吞吐量之外,Vera Rubin在Agentic Coding工作負載中的Token成本也大幅下降。
輝達指出,Vera Rubin NVL72每百萬Token成本相較Blackwell最高可降低35倍,使單一系統能夠長時間、大規模同時運行多個AI代理工具。
搭配NVIDIA DSX MaxLPS技術後,系統還能在GPU、機櫃及不同工作負載之間管理電力配置。
輝達表示,透過這套電力管理機制,AI工廠在相同1MW電力預算下,最多可以配置多40%的GPU。
目前測試還沒算進Vera CPU
值得注意的是,這次測試尚未計入Vera CPU在Tool Calling等工作負載中的效能,只聚焦Vera Rubin晶片本身,而非完整的「Extreme Codesign」7晶片平台。
因此,隨著更多完整Vera Rubin系統正式部署,輝達預期AI代理與推論效能仍有進一步提升空間。
目前輝達旗下新一代AI產品已陸續進入生產,包括Vera CPU、Rubin GPU、Vera Rubin伺服器、Groq 3 LPX推論晶片,以及相關網路產品。
來源:wccftech
![]()





