AI Infra Summit:NVIDIA Vera Rubin 與 DSX 平台最新進展,展現每瓦詞元最佳化所實現的 AI 工廠能源效率

作者

NVIDIA 超大規模與高效能運算副總裁 Ian Buck 週二在 AI Infra Summit 上,就人工智慧(AI)工廠效率發表演講。這場在聖塔克拉拉會議中心舉辦的活動,如今已發展為基礎設施科技界的 Coachella 音樂節。

今年活動吸引超過 8,000 人參加,高於去年的 3,500 人,現場座無虛席。Buck 也向聽眾分享 NVIDIA 各平台的最新合作與其他進展。

  • Amazon 旗下 Annapurna Labs 正與 NVIDIA 合作開發 NVHBM 客製化高頻寬記憶體技術。
  • d-Matrix 透過與 NVLink Fusion 整合,將 NVIDIA Vera CPU 與 d-Matrix Raptor XPU 結合,以實現大規模的超低延遲推論。

NVIDIA 與合作夥伴亦公布多項最新成果:

  • Emerald AI、NVIDIA 與 Silicon Valley Power 共同合作,展示商用 AI 工廠彈性負載計畫。
  • Lambda 透過 NVIDIA DSX MaxLPS 將每瓦效能提升 23%。
  • Pinterest 正運用 NVIDIA Blackwell 平台與 NVIDIA Dynamo 推論軟體,將對話式 AI 導入視覺探索。

在此同時,隨著代理型 AI 帶動全新類別的工作負載,AI 基礎設施需要提供更高的效能、效率與擴展能力。

NVIDIA 藉由全端 AI 工廠平台應對這項挑戰。該平台涵蓋 Vera Rubin 系統、Dynamo 推論軟體、NeMo 函式庫與 NVIDIA 網路技術,其中包括用於垂直擴展(scale-up)運算的 NVIDIA NVLink、用於連接數千個節點的 Spectrum-X 乙太網路與 ConnectX SuperNIC、由 BlueField 技術驅動的情境記憶體儲存,以及用於基礎設施安全的 BlueField DPU。

AI 基礎設施的衡量指標正迅速從峰值效能轉向經驗證的每百萬瓦代理型 AI 詞元數。AI 工廠如今必須從晶片到電網進行協同設計。NVIDIA DSX MaxLPS 可透過全工廠範圍的電力最佳化,將每百萬瓦產出的詞元數提升至多 1.4 倍,而 NVLink 則有助於將大規模加速運算整合為單一的高效能系統。

最終成果是打造出專為產生更多詞元、提升效率,並協助客戶從每百萬瓦電力中獲得更高價值而設計的 AI 基礎設施。


Vera Rubin 與 Groq 3 LPX 將更多電力轉化為詞元🔗

電力是 AI 工廠的主要限制。每一瓦都至關重要,因此如何從每百萬瓦電力產生更多詞元,已成為 AI 基礎設施最關鍵的課題。

NVIDIA 透過以 Vera Rubin NVL72 為基礎的全端 AI 工廠實現這項目標,讓系統、網路、軟體與電力管理協同運作。在工廠層級,NVIDIA DSX MaxLPS 會隨著需求升降,在不同機架之間動態分配電力。

其帶來的效益相當顯著:

  • 在相同站點的供電範圍內,GPU 數量增加至多 40%。
  • 詞元輸送量提升至多 35%,且無須增設電力線路。

在每個機架內,智慧型電力平滑化(Intelligent Power Smoothing)軟體與擴充的能源緩衝能力可吸收短暫的功率尖峰,讓系統在更接近持續需求的狀態下運作,進而將原本閒置的預留容量轉化為實際運算能力。

對於代理會串連多個推理步驟與工具呼叫的代理型 AI 而言,延遲與情境長度會迅速累積。這正是 NVIDIA Groq 3 LPX 發揮作用之處,可為 Vera Rubin 增添確定性的超低延遲推論能力,並與 DSX MaxLPS 相輔相成。在長情境下,針對參數量超過 2 兆的模型,這套整合平台的每百萬瓦詞元輸送量最高可達 GB200 NVL72 的 35 倍

資料清楚說明了一切。在情境長度為 10 萬的 Qwen 3.8 27B 工作負載上,Groq 3 LPX 達成每位使用者每秒輸出 2,529 個詞元的表現。這項額外效能讓代理即使面對不斷擴大的工作負載,也能在相同的回應預算內執行更多推理步驟與工具呼叫。

進一步瞭解 NVIDIA Vera Rubin NVL72 Groq 3 LPX 如何以更少電力產生更多詞元。


Vera Rubin NVL72 在 SemiAnalysis AgentX 實現高出 30 倍的 AI 工廠輸送量🔗

SemiAnalysis AgentX 透過紀錄上的真實世界代理型程式設計工作階段來衡量推論效能,並保留實際的情境增長、工具呼叫延遲與子代理啟動過程,而非僅採用單次要求的基準測試。NVIDIA Vera Rubin NVL72 的代理型效能結果現已公布於 SemiAnalysis AgentX 儀表板。在 DeepSeek V4 Pro 模型上,Vera Rubin NVL72 的每百萬瓦輸送量最高可達 NVIDIA GB300 NVL72 的 30 倍。

代理型工作負載的運作模式,不同於過去推論基準測試所衡量的請求與回應工作。當代理進行推理、呼叫工具並啟動子代理時,單一工作階段可能累積數十萬個輸入詞元,詞元量約為簡單聊天要求的 15 倍,且不同請求的輸入與輸出長度可能存在大幅差異。若要完整掌握端到端過程,便需要建立在完整代理軌跡基礎上的基準測試。AgentX 正是為此而設計,並與 MLPerf Inference 等標準化測試套件相輔相成,後者主要衡量各種模型與情境下的單次請求效能。

效率提升可直接轉化為 AI 工廠的經濟效益。每百萬瓦輸送量提升至多 30 倍,代表在相同能源使用量下,可完成至多 30 倍的代理型工作,而AgentX 結果亦顯示,每百萬詞元成本可降低至多 45 倍。在電力受限的部署環境中,每百萬瓦輸送量決定 AI 工廠能創造多少營收,而每百萬詞元成本則決定其利潤空間。

這項效能是極致協同設計的成果,包括 NVL72 垂直擴展(scale-up)運算域、第六代 NVLink 互連技術、第五代 Tensor Core 的 NVFP4 精度,以及涵蓋 NVIDIA TensorRT LLM 與 NVIDIA Dynamo 的推論堆疊。Vera Rubin 已全面進入量產,並在整個生態系中擴大部署,其效能也將隨持續進行的軟體最佳化提升。

進一步瞭解實現這些成果的平台架構。


隨著 AI 工廠擴展至數十萬顆 GPU,可靠性也成為影響效能的重要特性。

訓練與推論工作負載仰賴持續運作,因此暫時性錯誤、訊號衰減與硬體故障皆是無可避免的挑戰。NVIDIA NVLink 6 透過多層韌性架構因應這些挑戰,在故障影響應用程式之前加以偵測、控制並復原。

在物理層,客製化的前向錯誤更正、物理層重試與通用物理層復原機制,有助於維持無損的互連架構,並將延遲的影響降至最低。在網路層,基於信用額度的流量控制、動態路由與鏈路重新平衡,可將故障控制在局部範圍內,避免發生可能降低 AI 工廠輸送量的連鎖停滯。

進一步瞭解 NVIDIA NVLink 6