開放原始碼生態系統讓 AI 愛好者與開發者都能更輕鬆在本機建立、自訂及執行日益強大的代理。
整個八月,NVIDIA 都在向推動本機 AI 進步的合作夥伴與開放原始碼社群致敬,同時為整個生態系統中湧現的模型、應用程式與工具喝采。其中包括 NVIDIA 最新的開放式模型、軟體與開發者工具,還有能協助使用者入門的加速運算、程式庫與教育資源。
本月即將成為代理的重大月份。 NVIDIA 本機 AI 的部落格特刊系列未來幾週內將持續更新,敬請關注最新進展。
在 X、Instagram、TikTok 與 Facebook 上關注 NVIDIA RTX Spark — 並訂閱 NVIDIA Local AI newsletter,隨時掌握最新消息。 在 LinkedIn 和 X 上關注 NVIDIA 工作站。
Tuesday, Aug. 14, 10:00 a.m. PT
NVIDIA RTX GPU 為本機 AI 帶來前沿品質的 Qwen3.8-27B 編碼代理
NVIDIA 的 RTX GPU 系列為開發者提供高效能解決方案,可於本機上使用 Qwen3.8-27B 來達到前沿品質的編碼代理。
這款 270 億參數的開放式模型作為 Qwen3.8-Max 的本機夥伴,規模適用於單一 GPU,專門支援包含本機檔案、工具與專案情境的靈敏編碼工作流程。開發者可將敏感程式碼、專有資料與專案情境保留在自己的系統中,但於整個開發過程中都能使用強大的 AI 協助。

NVIDIA RTX GPU 系列現已提供零日支援,包括 NVIDIA RTX PRO GPU 與 NVIDIA GeForce RTX 5090。Qwen3.8-27B 已針對多 Token 預測最佳化,在單一 GeForce RTX 5090 上使用 MTP 可達每秒 131 個 Token,讓開發者能加快本機推論速度,以處理代理式編碼、工具使用以及較長時間的開發任務。
開發者可立即使用 llama.cpp、Ollama、Unsloth 與 LM Studio Bionic,這些產品全都在 NVIDIA RTX GPU 上支援 Qwen3.8-27B。NVIDIA RTX 效能、CUDA 軟體生態系統,以及常見的開放原始碼工具,共同為開發者提供廣泛的新模型支援,並奠定堅實基礎,為本機代理程式編碼工作流程賦予靈敏反應。
該模型也支援 DGX Spark 與 DGX Station,並即將推出其他最佳化功能,包括為所有 NVIDIA 本機 AI 裝置提供 NVFP4 支援。Qwen3.8-27B 為 NVIDIA 全天候運行的個人 AI 系統帶來前沿品質的本機編碼代理。
除了 PC 與個人 AI 系統,NVIDIA Jetson 還將 Qwen3.8-27B 的零日支援擴展至邊緣。我們發現該模型能力驚人,並具備強大的推理與代理功能,而透過 MTP 進行的推測性解碼技術,則可在邊緣進行快速、靈敏的本機推論。
Tuesday, Aug. 11, 10:00 a.m. PT
#ICYMI:由 NVIDIA GPU 加速的全新開放式模型與更多內容於今日推出
NVIDIA 最近推出 Cosmos 3 Edge,一款涵蓋 40 億參數的開放世界模型,適用於機器人技術、自動駕駛汽車與視覺 AI。 其大小只有 Cosmos 3 Nano 的四分之一,可在裝置上以 NVIDIA DGX Spark 與 NVIDIA Jetson 執行。
MiniMax-H3 是 330 億參數的開放式權重模型,能從文字、圖片、影片、音訊或四者任意組合,產生影片以及原生同步的立體聲音訊。創作者可透過 ComfyUI 存取,並透過針對 NVIDIA GPU 最佳化的檢查點在本機執行。
Poolside AI 推出 Laguna S 2.1,這款 1180 億參數的開放式權重代理式編碼模型,可處理數小時的任務。NVFP4 檢查點讓開發者能夠在單一的 NVIDIA DGX Spark 上以本機執行模型,在降低運算資源與記憶體需求的同時仍不失精準。
DeepSeek 最近更新了 DeepSeek-V4-Flash,一款 2840 億參數的 MoE 模型,支援 130 億有效參數,以及 100 萬 Token 的情境視窗。 開發者現在可以使用社群建置的 GGUF 版本,在 NVIDIA DGX Station 上於本機執行此工具。
Thinking Machines Lab 的 Inkling-Small 是一款前沿級的開放權重多型態模型,支援跨文字、影像與音訊的原生推理,並具備可調整的思考耗時。這款 2760 億參數的模型在 NVIDIA GB300 NVL72 上經過訓練,每個 Token 僅啟動 120 億參數,並且在單一的 DGX Station 或兩套 DGX Spark 系統上執行。 針對 NVIDIA Blackwell 最佳化的 NVFP4 檢查點已在 Hugging Face 上推出。
Unsloth 將於週一推出 Unsloth Desktop。該產品將本機模型推論、影像與影片擴散、微調、代理整合、網路研究與程式碼執行工作,整合至一個完全開放原始碼的桌上型 App。發佈資料將其定位為首款可在本機訓練與執行 AI 模型的桌上型 App。
Unsloth Desktop 將本機 AI 訓練與推論功能整合至一個完全開放原始碼的桌上型 App。
首款在本機訓練並執行 AI 模型的桌上型 App。
阿里巴巴最近推出 Wan-Animate-2。這款 140 億參數的開放式權重模型,可將駕駛影片中的動作與面部表情,轉移為靜態的角色影像,包括人類、卡通、機器人或動物。 與 Apple M3 Ultra 相比,此工具搭配 ComfyUI 的零日支援,在 NVIDIA RTX PRO 5000 Blackwell (48GB) 上的生成速度最高可快達 16 倍,在 NVIDIA RTX 5090 上則可快達 26 倍。
Tuesday, Aug. 11, 9:00 a.m. PT
LTX 推出 LTX-2.5
LTX-2.5 是 LTX 頂尖研究團隊新推出的最先進開放世界影片生成模型,為媒體與娛樂、機器人技術與即時生成的使用案例奠定基礎,並提供更高品質的影片、更高的提示詞遵循度,讓各個生成結果維持更一致的角色、場景與聲音。
全新的多鏡頭支援,讓創作者能在維持連續性的前提下生成跨多個鏡頭的序列,而升級的擴散影片解碼器則可提升視覺擬真度並減少假影。創作者也能透過生成式編輯技術來精修現有素材,讓修復細節更輕鬆,並維持精美畫面,無需從頭開始。
全新的提示強化器支援 Gemma4 E2B 與自訂 Gemma4 12B 文字編碼器,帶來厲害的提示遵循度,讓使用者更完整掌控輸出結果。
全新的擴散影片解碼器與變分自動編碼器影片解碼器相得益彰,可提升影片品質,以第二條解碼路徑產出更高品質的最終渲染成果。
LTX-2.5 已針對 NVIDIA RTX GPU、DGX Spark 與 DGX Station 系統最佳化,可提供 2 倍的效能提升並節省 40% 的記憶體。創作者可透過現成的 ComfyUI 工作流程,在本機使用這些 NVFP4、FastVideo 與 ComfyUI 增強功能,來產生文字、影像及影片轉影片。
進一步瞭解 LTX-2.5,以學習如何在 NVIDIA 硬體上開始在本機產生高品質影片。
Tuesday, Aug. 11, 9:00 a.m. PT
NVIDIA 為全天候運作的本機代理 AI 加速 Meta 的 Muse Glimmer
今日,Meta 推出 Muse Glimmer,一款 300 億參數密集型的開放權重模型,支援 120K+ 情境視窗。它專為編碼與本機代理 AI 而打造。
Muse Glimmer 已針對 NVIDIA GeForce RTX PC、DGX Station 與 NVIDIA Jetson 最佳化,在 RTX 5090 上每秒提供超過 200 個 token,讓全天候運作的代理在本機處理資料,並在單一系統上完成複雜的多步驟任務。
其密集的架構與混合式注意力,能幫助代理在執行長時間任務、使用工具以及跨多個步驟維護情境時,將運算與記憶體需求控制在可管理的範圍。
Muse Glimmer 是一款涵蓋 300 億參數的模型,已針對全天候執行的本機代理工作流程最佳化。 它小到足以於搭載單個消費級 GPU 的 PC 上執行,支援從本機代理與函數調用、本機編碼,到 LLM 即評估器等各種使用案例。
AI 愛好者與開發者可使用 NemoClaw 打造代理,並透過 NVIDIA NeMo Automodel 在本機微調 Muse Glimmer,使用私人或專業資料,同時將之保留在系統上。 Muse Glimmer 專為以下目的設計:
- 自訂代理:針對特定任務、工具、資料與專業領域調整模型。
- 私人資料處理:讀取、摘要及處理本機檔案、文件、電子郵件與訊息。
- 憑證處理:使用應用程式設計介面金鑰、驗證 Token 與其他敏感資訊,同時在裝置上進行推論。
- 多步驟任務:完成許多連續工具調用,並從錯誤或意外結果中恢復。
- 長期執行的工作流程:將大型專案分解為多個步驟、追蹤進度,並在恢復中斷工作階段的同時保留完整情境。
開發者可透過熱門的推論框架執行 Muse Glimmer,包括用於文字生成、影像、推理與工具使用的 vLLM,或是針對使用 BF16 和量化 GGUF 檢查點的文字與影像工作負載使用 llama.cpp。llama.cpp 也支援 DFlash 推測解碼以加速生成。
Muse Glimmer 在單一 NVIDIA RTX 5090 上執行,讓全天候執行的代理能夠處理私人檔案、應用程式與通訊,同時減少對雲端推論的依賴。

進一步瞭解 Meta 的 Muse Glimmer,並查看 NVIDIA 技術部落格,瞭解如何開始使用本機 AI,以及如何在 NVIDIA 硬體上微調。
Tuesday, Aug. 11, 8:00 a.m. PT
透過 NVIDIA Sync 叢集助理讓 DGX Spark 效能倍增

GLM 5.2 與 DeepSeek V4 Flash 等全新開放式模型,正在為本機系統帶來雲端級智慧,支援編碼與研究代理等進階工作負載。然而,多個 GPU 或 DGX Spark 系統可能需要協同工作,才能執行這些大型模型。
NVIDIA Sync app 更新可輕鬆將多個 DGX Spark 系統叢集起來,提供更快速執行大型模型所需的記憶體容量、推論效能以及訓練輸送量。
NVIDIA Sync 適用於 Windows 與 macOS,可自動偵測已連結的系統,透過 Tailscale 提供私密且安全的遠端存取,並讓開發者能在一或多個 DGX Spark 系統上發佈應用程式,無需手動設定網路或複製貼上終端指令。
NVIDIA Sync 中的叢集助理,可自動將兩台或更多 DGX Spark 系統設定為高速叢集。開發者透過 NVIDIA ConnectX-7 連接埠來連接系統,而 NVIDIA Sync 則負責設定網路、在節點之間路由工作負載,並監控系統健康狀況。
若要在 DGX Spark 上開始使用代理 AI,請查看 NemoClaw、OpenClaw、Hermes Agent 與 OpenShell 的腳本。
請參閱更多軟體產品資訊 通知 。
Tuesday, Aug. 11, 8:00 a.m. PT
其他 DGX Spark 更新
兩項專為開發者打造的厲害新功能,將於八月稍晚推出。
DGX Spark 將獲得原生 ARM64 Linux 版本的 Google Chrome 功能 — 從 DGX 儀表板按一下即可安裝。也就是說,Google 帳號同步、完整的擴充生態系、跨裝置連續性,以及其他平台隨附的所有標準功能,現在都能在你的 DGX Spark 上取用。只需登入一次,瀏覽器環境就會從筆記型電腦延續至 Spark。
全新的 NVIDIA Sync 資源監視器將為個別 DGX Spark 或整個叢集的 CPU 與 GPU 使用情況提供即時與歷史檢視,無需額外的監控軟體或設定。 一目了然的視覺化功能可協助使用者追蹤工作負載進度、在新增工作或模型之前檢查可用容量,並快速識別瓶頸或意外行為。 Marquee 縮放功能讓使用者能從整體工作負載切換至特定時刻,有助於更快排除故障,並從系統中獲得更多效益。
Tuesday, Aug. 11, 6:00 a.m. PT
NVIDIA 推出 Nemotron 3.5 Lightning,用於處理快速、專精的代理任務
今天,NVIDIA 推出 Nemotron 3.5 Lightning,為 Nemotron 3 模型系列再添新成員,這是一款專為全天候代理系統打造的可自訂開放式 30B 多專家 (MoE) 模型。
Nemotron 3.5 Lightning 與同級的開放式模型相比,可將 Token 生成速度提升最高達 4 倍,並將完成時間縮短 30%。
此外,Nemotron 3.5 Lightning 是開放權重,所以 AI 愛好者與開發者可運用自己的範例做微調,進一步配合特定的任務、興趣與工作流程。 例如,他們可以訓練模型來達成以下目的:
- 以偏好的風格書寫:在撰寫電子郵件、報告或其他文件時,能夠採用既定的語調、格式與術語。
- 學習專長:加強理解特定領域的語言和常見任務,例如攝影、遊戲或 3D 設計。
- 以特定方式編寫:在撰寫、檢視或重構程式碼時,遵循偏好的程式碼規範、框架與測試方法。
這些經過微調的模型,在可存取 App、檔案與其他工具的同時,還可支援更個人化的本機代理 AI 體驗:可以是協助管理電子郵件與日曆的助理,可以是處理日常生活的智慧型家居代理,也可以是與開發者在本機程式庫中協作的編碼夥伴。
NVIDIA 與 vLLM、Ollama、llama.cpp 及 LM Studio 合作,為 Nemotron 3.5 Lightning 模型提供最佳的本機部署體驗,讓開發者可選擇 NVFP4 與 GGUF 格式的模型。Unsloth 也在推出首日即提供支援,包括最佳化與量化模型,能透過 Unsloth Studio 執行高效率本機部署。
Nemotron 3.5 Lightning 可在 NVIDIA RTX PC、NVIDIA DGX Spark 與 OEM GB10 系統,以及 NVIDIA Jetson 上本機執行,並能擴充至 RTX PRO 工作站、NVIDIA DGX Station 與 GB300 桌上型系統、資料中心與雲端環境。Acer、ASUS、Dell Technologies、Exxact、GIGABYTE、HP、Lenovo、MSI 與 Supermicro 均提供 NVIDIA Blackwell 系統,有各式各樣的裝置與外型規格供使用者選擇,以滿足他們的需求。
隨著生成式 AI 的採用率持續上升,企業正想方設法控制不斷上升的 Token 成本,而不犧牲取得前沿智慧的管道。NVIDIA NeMo Switchyard 是一個開放原始碼路由程式庫,能根據準確度、速度與成本,自動將代理工作流程的每個步驟引導至最適合的模型。此外,開發者還能靈活地在各模型與供應商之間作業,以完成不同的任務。
內部基準測試結果顯示,NeMo Switchyard 透過模型系統路由每一道步驟,協助維持前沿級任務完成率,同時將基準測試的完成成本降低至僅約 Opus 4.8 單獨執行時的三分之一。 NeMo Switchyard 已於 GitHub 上架。
請造訪 Nemotron 3.5 Lightning 與 NeMo Switchyard 技術部落格,開始入門。 此外,若要在邊緣建構,首先請參考 Jetson AI Lab 教學,並探索真實的 Jetson 專案。Nemotron 3.5 Lightning 也可透過 OpenRouter 在 build.nvidia.com 上以 NVIDIA NIM 微服務形式提供,同時透過由 NVIDIA 雲端合作夥伴、後期訓練平台、推論平台與雲端服務供應商組成的廣泛生態系統推出。 NeMo Switchyard 已於 GitHub 上架。
