AI 工廠:智慧的新基礎架構

作者

AI 工廠是一種全新類型的基礎架構,專為需要隨時在線、即時產出的智慧而打造。在工業時代,發電廠將能源轉換為電力。在 AI 時代,AI 工廠將能源轉換為 token,也就是推理模型、代理程式與智慧系統的生產單位。

AI 工廠的經濟效益取決於其產出:每秒 token 數、每瓦 token 數、每個 token 成本、使用率與正常運作時間。在這個模式中,每瓦效能會直接轉化為營收。每個 token 成本則影響每一座 AI 工廠的經濟性。

AI 不再只是軟體。它已成為關鍵基礎架構。

AI 工廠將大規模基礎架構轉化為持續的智慧產物。

AI 工廠在服務數十億個請求的同時,同步大規模運算資源。它們由軟體協調,並由持續運作的自主多代理程式系統組成,全天候產生智慧。代理式系統會使用效能最佳的 AI 模型進行推理與規劃,這些模型涵蓋專有與開放模型,包括 NVIDIA Nemotron。開放模型可依企業特定領域需求進行客製化、最佳化並安全部署,而且全部都能在 AI 工廠上完成。

如今已在實際環境中運作的 AI 工廠,會在整個堆疊中進行最佳化,包括模型、運算、網路、記憶體、軟體、儲存、電力與冷卻,以保持智慧持續輸出。

代理 AI 會生成合成訓練資料,建立情境,協助自主系統從下一個終端案例中學習。

代理 AI 改變工作負載

AI 工廠是為一種新型工作負載而打造:隨時在線的推論,而且不只是回答提示 (prompt)。自主代理程式能推理、規劃、搜尋、使用工具、擷取資料、撰寫程式碼並採取行動。它們會建立自己的子代理程式,學習如何使用特定領域工具,並發展自己的 AI 技能。這些多代理程式系統讓 AI 工作負載變得更長、更深,也更耗費運算資源。這也改變了基礎架構必須承擔的工作。效能取決於能否讓整個工作流程高效率地持續推進,使智慧能為下一個步驟、下一個行動與下一個決策持續處於生產狀態。

自主代理程式重塑架構

自主代理程式仰賴加速運算搭配高速記憶體、用於脈絡的儲存、用於協調的網路、用於編排的軟體,以及用於執行的 CPU。工作負載會在整個堆疊中移動,而且往往在每一步都有嚴格的延遲要求。AI 工廠由完整堆疊系統組成,設計目標是以大規模高效率產生 token 所需的吞吐量、反應速度與使用率,讓這些工作流程持續運轉。

AI 工廠仰賴極致共同設計

硬體、網路、記憶體、儲存與軟體會共同架構,並在每一層持續最佳化,以提高使用率、降低每個 token 成本並提升產出。它們在隨時在線、互動式 AI 工作負載所需的反應速度,與最大化生產所需的吞吐量之間取得平衡。

推論是即時編排挑戰

隨著 AI 工作流程變得更長且更具互動性,工廠必須即時運作。這代表它需要路由請求、管理記憶體、協調服務、平衡延遲與吞吐量,並在整個堆疊中維持高使用率。在 AI 工廠中,軟體層至關重要,因為能否高效率運作工廠,決定了它能產出多少智慧、創造多少價值。推論已成為橫跨整台機器的即時編排挑戰。

但要高效率運作 AI 工廠,在系統正式上線之前就已經開始。同樣為推論所需的完整堆疊共同設計,也改變了 AI 工廠的規劃、驗證與上線方式。

在 AI 運算中,每瓦效能已成為衡量 AI 工廠競爭力的終極指標。資料中心過去儲存檔案,如今,AI 工廠產生 token。對 AI 生產者而言,這項產出會直接影響營收。對企業而言,每個 token 成本則決定了它們能否以有利可圖的方式擴展 AI。

SemiAnalysis InferenceX 基準測試以真實世界的角度量化了這項轉變。NVIDIA Blackwell Ultra GPU 提供最低的每個 token 成本,讓 AI 工廠能在相同功耗範圍內,以更低的單位成本產出更多智慧。每瓦更多 token 代表每單位基礎架構成本、空間或電力都能帶來更高吞吐量。更低的每個 token 成本則改善了大規模推論的經濟性。

相較於上一代,NVIDIA GB300 NVL72 系統每百萬瓦可產生多 50 倍的 token,與 NVIDIA Hopper 平台相比,每個 token 成本降低 35 倍。

採用 NVIDIA Blackwell Ultra 打造的 AI 工廠每百萬瓦吞吐量最高可提升 50 倍,帶來低 35 倍的每個 token 成本,在大規模環境中平衡效能、反應速度與能源效率。NVIDIA Dynamo 框架協助編排長脈絡推理與大規模推論吞吐量,隨著工作負載變得更互動且複雜,仍可維持高使用率。兩者共同展現了如今 AI 工廠效能的衡量方式:一座工廠能多高效率地即時產生智慧。

NVIDIA Vera Rubin 平台將這條曲線再次延伸。隨著推理與代理式 AI 持續擴展,Vera Rubin 系統的設計目標是透過 LPX 將每瓦效能最高提升 35 倍,並透過更深入的完整堆疊最佳化降低 token 成本。其結果是在工廠層級實現更高效率的智慧生產。

NVIDIA Vera Rubin 平台。

從晶片到完整堆疊 AI 工廠

一切始於 GPU,如今已擴展成完整堆疊 AI 工廠,涵蓋加速運算、高速互連、液冷系統、推論軟體、自主代理程式、參考架構,以及大規模建置與營運所需的生態系。

完整堆疊 AI 工廠是 NVIDIA 正協助定義與打造的更廣大生態系的一部分。NVIDIA 與 CiscoDellHPELenovoSupermicro 等全球系統合作夥伴密切合作,將 AI 基礎架構帶進企業資料中心。NVIDIA 也仰賴精選的 AI 軟體合作夥伴生態系,為每家企業的使用案例打造 AI 解決方案。這個生態系支援多種模型選擇,涵蓋專有與開放選項。

這些 AI 工廠可部署於廣泛的使用案例,從代理 AI 工作負載到物理 AI 與機器人。每個產業中的每個組織,從金融服務、生命科學到製造與公部門,都需要建置或租用一座 AI 工廠。

NVIDIA 營運自己的企業 AI 工廠,以加速整個公司的開發工作,並由數百個自主 AI 代理程式協助工程、軟體與營運團隊。這是一個實際證明:AI 工廠能轉變企業的建置、設計與營運方式。它們能提升企業內部生產力,讓 AI 從偶爾使用的工具,轉變為直接融入日常工作的能力。

AI 工廠可以從小規模開始,支援單一業務單位或工作負載;也可以從零開始建置,以大規模支援高效能 AI 推論與訓練。NVIDIA DSX 參考設計整合設計、模擬、營運與生態系技術,以每百萬瓦最低 token 成本打造十億瓦級 AI 工廠。

建置這些十億瓦級 AI 工廠所需的不只是最佳化運算。它需要一個共享數位環境,讓設施設計、硬體系統、電力、冷卻與營運能在建置前共同建模,並在部署後持續改善。NVIDIA Omniverse DSX Blueprint 以數位孿生支援這項工作流程,連接設施、硬體與軟體,並運用 Omniverse、OpenUSD 與 SimReady 資產,協助合作夥伴在整個 AI 工廠生命週期中驗證設計並最佳化營運。

完整堆疊方法能協助組織從每個系統中萃取更多智慧,將 AI 基礎架構轉變為自主、隨時在線的推理、行動與洞察引擎。上一場工業革命將能源轉換為工作。這一場革命則將能源轉換為智慧。AI 工廠是這個新時代的基礎架構,為下一波經濟成長提供動力。

進一步了解 AI 工廠如何成為 AI 時代的工業基礎架構。觀看 NVIDIA 創辦人暨執行長黃仁勳的主題演講,並進一步聆聽 NVIDIA GTC Taipei 來自客戶與合作夥伴的實際應用案例。