Into the Omniverse:開放世界模型如何推進物理 AI 前沿

作者

編註:本文是 Into the Omniverse 系列的一部分,該系列聚焦於開發者、3D 從業人員與企業如何運用 OpenUSD 與 NVIDIA Omniverse 的最新進展來轉型工作流程。

今年 7 月,NVIDIA 與超過 200 家企業及組織共同簽署「開放權重與美國 AI 領導力」公開信。信中主張,衡量 AI 領導力的標準,不在於任何單一前沿模型,而在於開放生態系能否觸及各個產業。

任何人都能下載、檢視、修改,並在自有基礎架構上執行的開放模型,正是實現這項願景的關鍵。這對物理 AI 尤其重要,因為每項部署都需要因應特定需求進行專業化調整。

物理 AI 不僅要理解表象,還必須理解並預測行動所帶來的後果。

為實現這項能力,世界模型會學習物理環境的運作方式、接下來可能發生的情況,以及後續應採取哪些合理行動。這些模型能生成符合物理原理的世界與行動資料、模擬未來狀態,並提供基礎,讓團隊能針對機器人、自駕車或視覺 AI 系統進行專業化調整。

開放世界模型已用於生成訓練資料、測試策略,以及專業化調整物理 AI 系統。NVIDIA Cosmos 3 將這些能力整合至開放模型家族,不僅在多項基準測試中取得領先成績,也獲得機器人、自駕車與視覺 AI 領域廣泛採用。

此外,作為 NVIDIA Agent Toolkit 一部分的 NVIDIA Omniverse 函式庫提供預先建置的功能,可打造適用於模擬的世界,讓物理 AI 團隊在實際部署前訓練、測試並驗證系統。

世界模型是物理 AI 的基礎

要以所需規模蒐集物理 AI 背後的資料,不僅困難且成本高昂。尤其是罕見事件與長尾情境,更難以安全且反覆地重現。

世界模型可實現:

  • 更實用的資料:透過大規模多模態情境,學習物理世界中的各種關係。
  • 更多元的環境:涵蓋不同天候、光線、物件與行進軌跡。
  • 更完善的基礎:可進一步建構並調整,以因應特定機器人、車輛、感測器配置、任務或作業環境。

通用模型並未接觸過各團隊特有的機器人、感測器或作業環境。要弭平這項落差,團隊必須能取得模型權重、允許調整模型的授權條款,以及後訓練所需的工具。

NVIDIA Cosmos 世界基礎模型採用 Linux Foundation 的 OpenMDW 1.1 授權條款,讓團隊能使用自有資料與硬體進行模型後訓練。正是在專業化調整的階段,開放性成為實際的技術需求。

模型專業化調整只是整體工作流程的一環。團隊還需要能生成資料、執行模擬及測試行為的環境。

Omniverse 函式庫協助開發者打造適用於模擬的環境,而 OpenUSD 則提供開放式框架,用於在數位孿生、模擬與合成資料生成工作流程之間,組合、重複使用及交換複雜的 3D 資料。Omniverse 與 OpenUSD 攜手減少重複工作,避免每當資產、感測器配置或環境條件有所變動時,工作量便不斷累積。

Cosmos 3:前沿模型

NVIDIA Cosmos 3 是採用混合 Transformer 架構打造的前沿開放式物理 AI 基礎全能模型,整合視覺推理、世界生成與行動預測能力。開發者可運用同一模型家族理解場景、生成合成資料、模擬未來狀態,並打造專業化的世界行動模型。

開發者可將 Cosmos 3 作為視覺語言模型、預測未來世界狀態並大規模生成合成資料且符合物理原理的世界模擬器,或世界行動模型的骨幹,無須為每項能力分別組建及維護不同模型。

此模型家族包括用於高擬真世界建模的 Cosmos 3 Super (64B)、用於高效率推理與後訓練的 Cosmos 3 Nano (16B),以及用於裝置端視覺推理與機器人策略部署的 Cosmos 3 Edge (4B)。Cosmos 3 Edge 足夠輕量,可在邊緣端 GPU 上執行,並能部署至 NVIDIA RTX GPU、NVIDIA DGX 系統與 NVIDIA Jetson,包括 Jetson Thor 平台。

在各項基準評估中,Cosmos 3 在開放權重文字轉圖像與圖像轉影片生成的 Artificial Analysis、世界生成的 PAI-Bench,以及 Physics-IQ 的圖像轉影片類別中均名列第一。在機器人策略方面,Cosmos 3 也在 RoboLab 排名第一;Cosmos 3 Super 更是 VANTAGE-Bench 視覺理解項目中排名最高的開放模型。

除了 Cosmos,NVIDIA 的物理 AI 技術堆疊還包括用於機器人的 Isaac GR00T、用於自駕車的 Alpamayo,以及用於視覺 AI 的 Metropolis。

開發者如何運用 Cosmos 3

各產業的開發者正以 NVIDIA Cosmos 為基礎建構物理 AI 應用:機器人領域包括 Doosan Robotics、LG Electronics、Samsung Electronics 與 Skild AI;自駕車領域包括 Li Auto、Xiaomi 與 Afari;視覺 AI 領域則包括 Centific、Fogsphere、Linker Vision、Milestone Systems 與 Yuan,這些公司正打造支援工業 AI 與智慧空間應用的視覺 AI 代理程式。

NVIDIA Cosmos 聯盟匯聚世界模型建構者、AI 開發者與物理 AI 領導者,共同貢獻模型、研究成果與評估方法,進一步擴展這項工作。NVIDIA 最近將聯盟版圖擴大至日本,當地機器人與製造業領導者計畫加入聯盟,為工廠、物流、農業、營造、醫療照護與運輸等領域開發開放世界模型。

這些實際部署與合作正共同奠定開放世界模型的地位,使其成為橫跨機器人、自駕車與視覺 AI 系統、可靈活調整的物理 AI 基礎。

掌握更多資源

探索以下資源,進一步了解世界模型、OpenUSD 與物理 AI 開發: