DiffusionGemmaとは:テキスト拡散モデルの概要
Google DeepMindが2026年6月10日に発表した実験的オープンソースモデルであるDiffusionGemmaは、従来の自己回帰型LLMとは全く異なるアプローチを採用しています。テキスト拡散プロセスを用いることで、256トークンを並列生成することが可能になりました。
📑目次
総パラメータ数は26Bですが、MoE構造により推論時にはアクティブ3.8Bのみを使用し、Apache 2.0ライセンスで公開されています。公式発表は https://deepmind.google/models/gemma/diffusiongemma/ で確認できます。
性能ベンチマークとハードウェア要件
NVIDIA H100では1,000トークン/秒を超える速度を記録し、RTX 5090では700トークン/秒以上を実現しています。これは従来の自己回帰モデル比で最大4-5倍の高速化です。
| 項目 | 値 | 備考 |
|---|---|---|
| 総パラメータ | 26B | MoE |
| アクティブ | 3.8B | 推論時 |
| 最大速度 | 1000+ tok/s | H100 |
| VRAM要件 | ~18GB | 量子化時 |
| 並列生成 | 256 tokens | 1パス |
出典: https://blog.google/innovation-and-ai/technology/developers-tools/diffusion-gemma-faster-text-generation/ , https://ai.google.dev/gemma/docs/diffusiongemma (2026年6月時点)
従来Gemma/Geminiとの違いと位置づけ
Gemma 4をベースにしていますが、生成方式が根本的に異なり、双方向注意機構で全体文脈を同時考慮します。自己修正機能によりブロック全体を反復精査し、フォーマット閉じやエラー修正に強い点が特徴です。
ローカル低並行度ワークロード向けに最適化されており、クラウドの高QPS用途には不向きです。品質はGemma 4よりやや低めですが、インタラクティブなリアルタイム用途で優位性を発揮します。
ユースケースと開発者向け実用性
インライン編集、コードインフィリング、数学的グラフ、Sudoku型依存タスクに最適です。並列生成により非線形タスクで優位性を示します。ローカルGPU運用や高速AIアシスタント構築に有効です。
推奨設定として、最大48 denoising steps、温度スケジュール0.8→0.4、適応早期停止(エントロピー閾値0.005)を推奨します。
制限事項と注意点
短い生成では効率が低下し、単一トークンエラーで全体が無効化されるリスクが高くなります。クラウド大規模バッチ処理では自己回帰型が依然として有利です。実験的モデルであるため、本番用途ではGemma 4を推奨します。
DiffusionGemmaの始め方とエコシステム
Hugging Face、Kaggle、Vertex AI Model Gardenから重みを取得できます。推論にはHugging Face Transformers、vLLM、MLXが対応しており、llama.cppも近日対応予定です。Fine-tuningにはUnslothやHackable Diffusion (JAX)、NVIDIA NeMoが利用可能です。
よくある質問(FAQ)
関連記事:
- Google Gemini 3.1 Pro の Gemini-SQL2 が BIRD Text-to-SQL で 80.04% SOTA 達成
- Google、Gemini 3.5 Live Translate発表 — 70言語以上対応のリアルタイム音声翻訳
- GLM-5.2 リリース — 1Mトークン context + 長時間エージェント/コーディング特化(MITオープンウェイト)
まとめ
DiffusionGemmaはテキスト拡散による並列生成でローカルAIの可能性を広げるモデルです。GPUローカル運用や高速インタラクティブワークフローを求める開発者にとって有力な選択肢となります。まずはHugging Faceから重みを入手して試してみてください。
関連する新しい記事:
- Google Gemini Managed Agents API GA — マネージドsandboxで単一APIコールによるagent実行を実現 – This published update adds current operational context for GoogleがDiffusionGemmaを発表:テキスト拡散で最大4倍高速なローカル生成へ.
- Gemini 3.5 Flash に Computer Use 正式統合 — ブラウザ/モバイル/デスクトップ横断エージェントが容易に – This published update adds current operational context for GoogleがDiffusionGemmaを発表:テキスト拡散で最大4倍高速なローカル生成へ.
- Gemini Study Notebooksの使い方と学習効果を最大化するポイント – This published update adds current operational context for GoogleがDiffusionGemmaを発表:テキスト拡散で最大4倍高速なローカル生成へ.
- agents-cli v1.0.0徹底解説 — Google公式CLIでClaude CodeやCursor対応のAIエージェントを即作成・評価・Cloud Runデプロイ – This published update adds current operational context for GoogleがDiffusionGemmaを発表:テキスト拡散で最大4倍高速なローカル生成へ.
著者
krona23
IT業界20年以上の実務経験を持ち、日本国内有数のPVを誇る大規模Webサービスで事業部長・CTOを複数社で歴任。Windows/iOS/Android/Webと技術の変遷を経験し、現在はAIネイティブへの変革に注力。DevGENTでは、AIコードエディタ・自動化ツール・LLMの実践的な使い方を日英西3言語で発信中。













コメントを残す