今天,Google DeepMind 發佈 DiffusionGemma,這款實驗性開放式模型專為超高速文字生成而打造。 NVIDIA 已最佳化 DiffusionGemma,無論是從本機 PC 到雲端,都能在 NVIDIA GeForce RTX GPU、NVIDIA RTX PRO 平台與 NVIDIA DGX Spark 系統上更快執行。
與一次只生成一個字詞的傳統方式不同,DiffusionGemma 採用平行處理、一次生成多個字詞,以區塊為單位輸出全文,為開發者、研究人員與 AI 愛好者每天執行的單一使用者工作負載,開啟了低延遲的新領域。
新模型的功能包括:
- 平行生成:DiffusionGemma 每個步驟最高可對 256 個 token 進行去噪,而不是一次預測一個。
- 以 Gemma 4 為基礎:DiffusionGemma 以 Gemma 4 為基礎,這是一款 260 億參數的混合專家模型,每個步驟僅啟動 38 億參數,將擴散頭與 Google 的 Gemma 4 架構配對。
- 效能提升最高達
- 開放式且位於本機:DiffusionGemma 在寬鬆的 Apache 2.0 授權下開放權重,完全在 RTX 與 DGX Spark 上執行,無需雲端、無需每 token 的成本,並在 Hugging Face Transformers、vLLM 與 Unsloth 中提供零時差支援。
生成文字的不同方式
如今廣泛使用的幾乎每款大型語言模型 (LLM) 都是自動迴歸式的,也就是說一次生成一個 token 的文字,每個新單詞都取決於前一個單詞。 正是這個連續過程讓互動式 AI 感覺像是在打字。
DiffusionGemma 採取了不同的路徑。 它以 Gemma 4 26B 混合專家 (mixture-of-experts) 架構為基礎,生成文字的方式與擴散模型生成影像的方式相同:從雜訊開始,然後一次性細化整塊文字。每個步驟皆可平行去噪高達 256 個 token,而非逐一輸出單一 token 後再等待運算下一個。
最後便會打造出一個以區塊為單位進行思考,而不是按順序思考的模型。對於延遲敏感的單一使用者工作 (例如互動式聊天、代理式迴圈或負責規劃與行動的裝置上助理),這種並行處理能力可轉化為足夠快速的回應,以跟上開發者思考與迭代的速度。
DiffusionGemma 在 NVIDIA GPU 上飛速運行
一次生成一個 token 從根本上來說是受限於記憶體的問題;在批次大小為 1 時,傳統 LLM 的大部分時間都花在等待記憶體頻寬上,而非進行運算,這導致大量的運算效能浪費。
Diffusion 顛覆了這個等式。 透過 Transformer 並行處理完整的 256 個 token 區塊是受限於運算的工作負載,這正是 NVIDIA GPU 的設計宗旨。NVIDIA Tensor 核心可加速密集的平行運算,而 CUDA 軟體堆疊讓模型從第一天起就高效執行,無需特別調整。 簡而言之,模型設計直接發揮 GPU 的優勢。
這項優勢在 NVIDIA 的全套產品陣容中均適用,包括:
- 在NVIDIA DGX Spark 桌上型個人 AI 超級電腦上本機執行。該產品由 NVIDIA GB10 Grace Blackwell 超級晶片驅動,支援 128GB 統一記憶體,並預安裝 NVIDIA AI 軟體堆疊,可直接用於原型設計、微調及完全本機代理工作流程。
- 在 NVIDIA RTX PRO 6000 工作站上,為開發者、研究人員與 AI 專業人士提供空間,以便他們執行本機低延遲生成與代理式循環,作為專業工作流程的一環。
- 在
- 在 GeForce RTX GPU 上,即將支援cpp。
在本機開始
開始測試模型並製作原型的最快方法是透過 Hugging Face Transformers,可讓 DiffusionGemma 在 GeForce RTX 5090 或 DGX Spark 上開箱即用。對於更高輸送量的推論,vLLM 提供零日服務支援。
若要將模型應用於特定任務或領域,可透過 Unsloth 與 NVIDIA NeMo 框架進行微調,並提供現成的 DGX Spark 操作手冊,協助快速建置本機環境。查看 DGX Spark、RTX PRO 與 DGX Station 的 vLLM 腳本。
在 Hugging Face 上試用 Diffusion Gemma ,或在 build.nvidia.com 使用 NVIDIA 託管的應用程式介面免費試用。
閱讀 NVIDIA 技術部落格與 Google DeepMind 公告,進一步瞭解架構與地端部署。
#ICYMI:RTX AI Garage 最新消息
🎬 NVIDIA 研究人員發布 SANA-WM,這款開源世界模型可將單一影像與相機路徑轉換為一分鐘長的 720p 影片,支援精準的 6-DoF 控制。 其精煉版僅有 26 億參數,可在單個 NVIDIA GeForce RTX 5090 GPU 上使用 NVFP4 格式,在 34 秒內生成完整的 60 秒剪輯,在單個 GPU 上執行時,比同級開放模型最高可提升 36 倍的輸送量。 閱讀論文。
🛠️ 建構 Windows Agent 現在擁有一整套工具—NVIDIA 與 Microsoft 在原生 Windows 上推出可一鍵部署的 Agent 沙盒環境 — Microsoft eXecution Containers 加上 NVIDIA OpenShell 執行環境 — 同時帶來速度最高快上 2 倍的代理式推論效能,以及對 Hermes Agent 的原生 Windows 支援。
🤖DGX Spark 從開箱到執行代理只需幾分鐘—透過簡化的 NVIDIA NemoClaw 安裝,開發者能快速獲得可運作的本機代理程式,且 Qwen3.6-35B 在 vLLM 上的執行速度最高可提升 2.6 倍。此外,NVIDIA Sync 的全新叢集助理最多可將四台 DGX Spark 單元連結至一個 512GB 資料池,足以支援 4000 億參數的模型。
在 Facebook、Instagram、TikTok 與 X 上關注 RTX Spark,並訂閱 RTX Spark 電子報隨時掌握最新消息。
請參閱軟體產品資訊相關聲明。
