Groq 3 LPX 全面進入量產,NVIDIA 擴展 Vera Rubin 的代理推論能力

作者

下一個人工智慧(AI)推論時代,不會由單一突破性的晶片、網路或系統所定義,而是取決於 AI 工廠的每一層架構如何協同運作。正因如此,NVIDIA 正擴展 Vera Rubin NVL72,為代理型系統提供高速詞元生成能力。

NVIDIA 今日宣布,NVIDIA Vera Rubin 機架級系統NVIDIA Groq 3 LPX,現已全面進入量產。在執行開源代理型模型 Gemma 4 31B 的Artificial Analysis基準測試中,NVIDIA Groq 3 LPX 針對代理型系統至關重要的 10 萬詞元長情境使用案例,每秒可輸出 3,400 個詞元,速度較最接近的替代平台快 4 倍。

全球產業合作夥伴正陸續採用 Vera Rubin 平台解決方案。SpaceXAI 宣布將採用 NVIDIA Vera CPU,驅動其下一代代理型 AI。CoreWeave 已在生產環境部署 Spectrum-X Multiplane,透過多組平行交換器連接 NVIDIA Vera Rubin 機架,打造高頻寬、扁平化且無損的 AI 網路。Nebius 則成為首家採用 NVIDIA Groq 3 LPX 的 AI 雲端。

隨著 AI 從訓練階段轉向推理與代理型應用,推論已成為新的技術前沿。代理型 AI 系統正生成更多詞元、處理規模大幅增加的情境視窗,並日益與其他 AI 系統協作以解決複雜問題。

這類工作負載需要新型的基礎設施,不僅針對效能進行最佳化,更須在前所未有的規模下兼顧資料輸送量、回應速度與經濟效益。

在本週於美國加州帕羅奧圖舉行的 Hot Chips 大會上,NVIDIA 將展示極致協同設計如何從端到端重塑 AI 工廠。透過將運算、網路與推論加速架構設計為單一系統,NVIDIA 協助客戶打造專為長情境推論與多代理系統等新興需求量身打造的基礎設施。

極致協同設計最佳化效能

極致協同設計是 NVIDIA 平台背後的核心設計原則。Vera Rubin 專為加速推論而打造,讓代理能針對日益增長的長序列進行推理。

NVIDIA Spectrum-X Ethernet 可在 AI 工廠間高效傳輸龐大的資料流,而 NVIDIA Groq 3 LPX 則專為超高速詞元生成而打造。兩者共同展現 NVIDIA 如何在單一、整合的 AI 工廠架構中,最佳化 AI 流程的每個階段,從情境處理、通訊到生成。

NVIDIA Groq 3 LPX 帶來全新的低延遲推論架構,可與最具靈活性的 AI 工廠平台 Vera Rubin NVL72 協同運作,協助企業與雲端服務供應商提供代理型應用所需的低延遲、極高輸送量與可擴展的經濟效益。

突破性的效能並非來自個別元件的獨立最佳化,而是源自對技術堆疊每一層的協同設計。從網路、情境處理到大規模推論,NVIDIA 全端平台將 AI 工廠轉變為整合式智慧引擎,讓持續增加的詞元產出轉化為營收。


NVIDIA 合作夥伴採用 Vera Rubin,實現最低詞元成本🔗

領先的 AI 雲端服務供應商 Nebius 率先採用 NVIDIA Groq 3 LPX,讓開發者能運用業界領先的詞元生成速度,打造反應極為靈敏的代理型 AI 應用。

Nebius Token Factory 將 NVIDIA Groq 3 LPX 加入 NVIDIA Vera Rubin NVL72 後,可進一步提升推論效能,讓開發者能大規模打造高度互動的代理、程式設計系統及其他即時 AI 體驗。

CoreWeave 透過連接 NVIDIA Vera Rubin 機架,正在生產環境部署 Spectrum-X Multiplane,為其 AI 雲端基礎設施帶來突破性進展


SpaceXAI 採用 NVIDIA Vera CPU 推動代理型 AI🔗

SpaceXAI 計畫以 NVIDIA Vera Rubin 為核心,建構並擴展其未來的 AI 架構,範圍從地球上的資料中心,一路延伸至軌道衛星。該公司計畫部署 NVIDIA Vera CPU,以加速代理型 AI 背後高度仰賴 CPU 的工作,包括協調管理、工具使用、程式碼執行、資料處理與模擬。

NVIDIA 與 SpaceXAI 的合作,將 NVIDIA 全端 AI 平台延伸至 SpaceXAI,整合 Vera CPU、NVIDIA 加速運算、網路與軟體,以前所未有的規模推動 AI 發展。

Vera Rubin 專為代理時代設計,具備業界領先的單核心效能、卓越的記憶體頻寬,以及在高負載下仍可預測的穩定效能,協助代理更快完成任務,同時讓高價值的 GPU 基礎設施維持充分利用。


NVIDIA Groq 3 LPX:互動式 AI 推論加速器🔗

NVIDIA Groq 3 LPX 與 Vera Rubin NVL72 平台協同設計,協助人工智慧(AI)工廠以最低延遲為代理型工作負載生成詞元。

代理型 AI 正帶來一項新的效能挑戰:解碼延遲(decode latency)。當 AI 代理進行推理、使用工具並與其他系統互動時,它們會以逐個詞元的方式產生回應,因此即使是極微小的延遲,也會在複雜的工作鏈中不斷累積。為了讓代理能以使用者所期待的速度維持運作,NVIDIA Groq 3 LPX 為 Vera Rubin NVL72 平台加入專門針對詞元生成的加速能力。

NVIDIA Rubin GPU 負責處理大規模情境,LPX 則加速對延遲高度敏感的解碼工作負載。如此一來,可實現更快速且更可預測的詞元生成,有助於 AI 工廠實現反應更即時的推理、更流暢的代理互動,以及更高的基礎設施效率。

Rubin GPU 與 LPU 協同運作,旨在消除速度與輸送量之間的傳統取捨,協助 AI 供應商為下一代代理型應用提供反應靈敏且大規模的推論能力。

打造詞元工廠

隨著產業從模型訓練轉向大規模提供智慧服務,基礎設施也必須演進成 NVIDIA 所稱的「詞元工廠(token factory)」,同時兼顧效能、輸送量、智慧完整性與經濟效益。代理型 AI 系統日益需要與其他 AI 系統進行通訊、存取多重資料來源並維持大量情境,使市場對快速推論的需求達到前所未有的程度。

NVIDIA Groq 3 LPX 正是針對這類工作負載而設計。作為 Vera Rubin NVL72 的延伸,它即使面對龐大的情境視窗,仍可提供超高速回應,同時協助服務供應商最大化輸送量與基礎設施使用率。

用於推論的極致協同設計

有別於獨立加速器,NVIDIA Groq 3 LPX 透過極致協同設計,結合 GPU 與 LPU 的優勢。Rubin GPU 與 LPU 共同運算 AI 模型的每一層,為代理型工作負載帶來全新層級的推論效能。

在大規模部署下,LPU 叢集可如同一個針對確定性推論最佳化的巨型處理器運作。一套機架級的 NVIDIA Groq 3 LPX 部署可包含 256 個 LP30 加速器,並透過晶片對晶片直接互連,從而形成專為現代 AI 工廠打造的高效推論引擎。

專為代理 AI 時代打造

隨著推理模型不斷擴展,代理型工作流程生成的詞元愈來愈多,支援這些需求的基礎設施必須隨之演進。NVIDIA Groq 3 LPX 為 Vera Rubin NVL72 平台加入專為推論打造的架構,旨在最大化回應速度、輸送量與效率,協助驅動下一代 AI 工廠。

而這只是開始。搭配 Vera Rubin NVL72 使用,NVIDIA Groq 3 LPX 未來將帶來更多最佳化、支援更多模型並實現更高效能,全新層級的輸送量與互動體驗即將到來,敬請期待。


NVIDIA Spectrum-X Multiplane 以更扁平、更具韌性的網路,實現大規模 AI 工廠擴展🔗

隨著 AI 工廠規模持續擴大,網路已成為驅動效能的關鍵引擎。在 Hot Chips 大會上,NVIDIA 將重點展示 Spectrum-X Multiplane,這是硬體加速 Spectrum-X 乙太網路架構的最新技術成果,讓乙太網路能擴展至前所未有的規模,同時避免新增網路層級所帶來的延遲、抖動與成本問題。

NVIDIA Spectrum-X 乙太網路是一款端到端、針對人工智慧(AI)最佳化的乙太網路平台,結合 NVIDIA Spectrum-X 乙太網路交換器、SuperNIC 與軟體,以提升 AI 工廠與雲端環境中乙太網路 AI 基礎設施的效能與效率。相較於現有的乙太網路解決方案,該平台可提供 1.6 倍的 AI 網路效能,並在多租戶環境中提供穩定且可預測的效能。

多平面架構即可實現擴展,無需犧牲新增網路層級

若要讓 AI 工廠超越現今最大規模的叢集,通常必須增加第三層網路架構,這不僅會提高延遲、造成難以預測的效能下降,也會增加纜線、光學元件與電力成本。Spectrum-X Multiplane 採取更簡潔的方式:將每台伺服器的網路連線分成數條獨立路徑,也就是多個「平面(planes)」,每個平面各自運行輕量化的雙層網路。如此一來,即可建立扁平且簡潔的網路架構,最高擴展至 512,000 顆 GPU,而無需承擔第三層網路所帶來的額外成本與複雜性。

整個過程均自動完成。NVIDIA ConnectX SuperNIC 內建的專用硬體引擎會管理各平面之間的流量,並能立即繞過任何故障點重新路由,因此應用程式與軟體端只會看到一條快速且可靠的連線。在八平面拓撲架構中,即使其中一個平面發生故障,網路仍可維持約 90% 的總頻寬,且硬體復原速度比基於軟體的多平面負載平衡快 11 倍,進而讓 AI 工廠產出提升 1.6 倍。

以極致協同設計打造

這項可靠性來自 Vera Rubin NVL72 的極致協同設計,涵蓋交換器晶片、SuperNIC 與軟體。Spectrum-X SN6000 系列交換器採用 102.4 Tb/s Spectrum-6 乙太網路 ASIC,搭配 ConnectX-9 SuperNIC,可支援每個 GPU 最高達 1,600 Gb/s,專為 Vera Rubin NVL72 AI 工廠量身打造。Spectrum-XGS 乙太網路則將相同的協同設計延伸至跨資料中心環境,使多座設施能如同單一 AI 超級工廠般運作,並將多站點 NCCL 集合通訊加速 1.9 倍。


NVIDIA 推出由 BlueField-4 與 DOCA 驅動的代理型 AI 工廠 Scale-In 基礎設施🔗

NVIDIA 推出 NVIDIA Scale-In,這是 NVIDIA 人工智慧(AI)網路的第五大支柱,也是專為代理型 AI 工廠打造的新一代加速網路基礎設施。Scale-In 將專為特定用途設計的加速技術延伸至負責保護、管理及維運 AI 工廠的基礎設施服務。

NVIDIA Scale-In 由 NVIDIA BlueField-4 處理器與 NVIDIA DOCA 軟體平台驅動,並透過 NVIDIA Spectrum-X 乙太網路連接,可將傳統的南北向存取網路轉變為統一的加速基礎設施領域。

雲端運算將軟體定義網路、可組合性與彈性帶入資料中心,讓使用者、應用程式、資料與服務都能動態擴展。

代理型 AI 代表下一次平台轉型。AI 工廠將大規模加速運算與持續增加的使用者、應用程式及自主代理整合在一起,而這些元素會持續與資料、儲存系統及各類服務互動,使支撐 AI 運作的基礎設施需求徹底改變。如今,網路、儲存、資安與營運都必須與 AI 運算同步加速,並結合軟體定義的靈活性、專用硬體加速與全端協同設計。

NVIDIA Scale-In 提供多租戶網路、高效能儲存存取、晶片內建安全性、彈性資源配置與即時可觀測性,同時讓基礎設施處理作業不占用主機運算資源。透過將這些服務加速並納入 AI 工廠的協同設計,Scale-In 可讓安全性、資料存取與營運能力隨著 AI 運算同步擴展,進而打造安全、高效且易於管理的共用基礎設施,以超大規模部署與營運代理型 AI。


NVIDIA NVLink Fusion 將連接至 NVIDIA 領先的 AI 平台🔗

NVIDIA NVLink Fusion 將客製化晶片整合至 NVIDIA 世界領先的人工智慧(AI)基礎設施平台,讓超大規模雲端服務供應商與 AI 原生企業能打造具備更高效能、靈活性與建置速度的半客製化 AI 工廠。

隨著 AI 模型的規模與複雜度持續增加,單靠原始運算能力已不足以因應需求。AI 工廠需要高頻寬、低延遲的垂直擴展(scale-up)網路、經過驗證的機架級架構,以及涵蓋電力、散熱、管理軟體與供應鏈的完整生態系。NVLink Fusion 透過將客製化 XPU 與 CPU 連接至 NVIDIA 的垂直擴展與水平擴展(scale-out)技術堆疊,協助解決這些挑戰。

該平台包含專為垂直擴展網路設計的第六代 NVIDIA NVLink 與 NVLink Switch,以及用於在 XPU 與 CPU 之間實現高能效連線的 NVLink-C2C。透過 NVIDIA MGX 生態系,採用 NVLink Fusion 的業者亦可運用經生產環境驗證的機架設計、元件、製造合作夥伴解決方案,以及開放且可擴充的軟體,以支援分散式運算、解耦式工作負載與叢集管理。

藉由將基於 GPU 與 XPU 的系統標準化為統一架構,NVLink Fusion 有助於讓資料中心建置不再受制於晶片就緒時程。營運商可共用機架空間、網路、散熱、供電與管理系統,並隨著供應與工作負載需求的變化,彈性調整 GPU 與 XPU 的配置比例。

NVLink Fusion 將 NVIDIA AI 平台「垂直整合、水平開放」的理念延伸至客製化晶片,讓合作夥伴得以在自身具備差異化優勢的領域自由創新,同時運用 NVIDIA 橫跨運算、網路、基礎架構與軟體的技術,從而打造一座統一且靈活、任何單一企業都無法獨自建構的 AI 工廠。