輝達Vera Rubin主打AI代理 吞吐量較Blackwell提升30倍、Token成本降35倍

記者黃仁杰/編譯

輝達(NVIDIA)公布Vera Rubin平台最新AI代理實測結果,顯示在代理式AI推論工作負載下,Vera Rubin NVL72的吞吐量大幅超越Grace Blackwell NVL72,同時進一步降低Token運算成本,鎖定未來大規模AI代理工具部署需求。

nvidia ceo jensen huang spotlights vera rubin
在代理式AI推論工作負載下,Vera Rubin NVL72的吞吐量大幅超越Grace Blackwell NVL72,同時進一步降低Token運算成本。(圖/輝達提供)

此次測試由輝達使用真實的Agentic Coding工作流程進行,採用SemiAnalysis AgentX基準測試,評估Vera Rubin等AI基礎設施執行代理式程式設計推論的表現,測試模型包括Kimi K3、MiniMax M3、GLM5.3、Qwen3.5及DeepSeek V4 Pro。

Blackwell每MW吞吐量最高較Hopper提升80倍

在Blackwell平台方面,GB300 NVL72「Grace Blackwell」伺服器執行DeepSeek V4 Pro 1.6T時,每MW功率可提供的吞吐量,是H200 NVL8「Hopper」方案的15倍。

輝達表示,這代表在相同電力預算下,Blackwell能維持更高且反應更快的AI代理推論吞吐量。

成本方面,Blackwell每百萬Token的成本則比前一代降低10倍,使AI營運商能在相同電力與基礎設施預算下部署更多AI Agent,或以更低營運成本提供相同運算能力。

當模型規模進一步放大至Kimi K3 2.8T時,Blackwell相較Hopper的每MW吞吐量甚至提升80倍,同時能維持每位使用者每秒215個Token的互動速度。

「AI履歷健檢」看見自己優勢:https://campaign.1111.com.tw/resume-review/

更多科技工作請上科技專區:https://techplus.1111.com.tw/

Vera Rubin吞吐量再比Blackwell高30倍

進入Vera Rubin世代後,效能差距進一步拉大。

根據輝達測試,Vera Rubin NVL72在DeepSeek V4 Pro 1.6T工作負載下,吞吐量較Grace Blackwell NVL72提高30倍。

在互動效能方面,Vera Rubin約可維持每位使用者每秒160個Token,最高更可達約280 TPS;相比之下,Blackwell峰值低於每位使用者每秒180個Token。

每百萬Token成本最高降低35倍

除了吞吐量之外,Vera Rubin在Agentic Coding工作負載中的Token成本也大幅下降。

輝達指出,Vera Rubin NVL72每百萬Token成本相較Blackwell最高可降低35倍,使單一系統能夠長時間、大規模同時運行多個AI代理工具。

搭配NVIDIA DSX MaxLPS技術後,系統還能在GPU、機櫃及不同工作負載之間管理電力配置。

輝達表示,透過這套電力管理機制,AI工廠在相同1MW電力預算下,最多可以配置多40%的GPU。

目前測試還沒算進Vera CPU

值得注意的是,這次測試尚未計入Vera CPU在Tool Calling等工作負載中的效能,只聚焦Vera Rubin晶片本身,而非完整的「Extreme Codesign」7晶片平台。

因此,隨著更多完整Vera Rubin系統正式部署,輝達預期AI代理與推論效能仍有進一步提升空間。

目前輝達旗下新一代AI產品已陸續進入生產,包括Vera CPU、Rubin GPU、Vera Rubin伺服器、Groq 3 LPX推論晶片,以及相關網路產品。

來源:wccftech

Loading

發佈留言

Back to top button