GoogleのAI研究部門であるDeepMind(ディープマインド)は2026年10月6日、オンデバイス向けマルチモーダル埋め込みモデルであるEmbeddingGemma 2を公開しました。
このモデルは、テキスト、コード、画像、音声、動画という5つの異なる形式のデータを、単一の共有ベクトル空間(意味的な近さを数値化した空間)にマッピングできるのが特徴です。Apache 2.0ライセンスの下で公開されており、スマートフォンなどのコンシューマー向けハードウェア上で完全に動作するように設計されています。
埋め込みモデルが実現することとオンデバイスの利点
ここでいう埋め込みモデルとは、コンテンツを意味に基づいた数値の配列(ベクトル)に変換する技術のことです。これにより、単なる文字の一致ではなく、意味の近さで情報を検索することが可能になります。
通常、こうした処理はクラウド上の強力なインフラで行われますが、EmbeddingGemma 2はデバイス上で動作します。Google社の発表によると、これによりネットワークを介さないため、データの転送に伴うプライバシー上の懸念を避けられるほか、低遅延でオフラインでの推論が可能になると説明しています。
具体的な活用例としては、音声メモから特定のビデオクリップを探し出したり、テキストによるクエリで数時間にわたる音声録音を検索したりといった操作が、単一のモデルで処理できるようになります。
効率的な設計と柔軟な構成
EmbeddingGemma 2は、軽量マルチモーダルAIモデルであるGemma 4のアーキテクチャに基づいて構築されています。最大の特徴はモジュール式の構造を採用している点です。開発者は必要に応じて以下の構成を使い分けることができます。
- テキストとコードのみ:2億7000万パラメータ
- テキスト + ビジョン(画像):4億4000万パラメータ
- テキスト + オーディオ(音声):5億7000万パラメータ
- フルマルチモーダル(すべて):7億4000万パラメータ
これにより、リソースの限られた環境でも効率的に動作します。例えば、Google Pixel 11 Proで量子化(モデルを軽量化する技術)を用いて動作させた場合、テキストのみの構成であれば約191MB、フルモデルでも約567MBのRAMで動作するとされています。
また、Matryoshka Representation Learning(MRL)という手法を導入しており、出力されるベクトルを768次元から512、256、あるいは128次元へと動的に切り詰めることが可能です。Google社によれば、これによりローカルのベクトルデータベースのストレージ使用量を最大6倍削減できるとしています。
前世代からの進化と性能
2025年に導入された初代EmbeddingGemmaと比較して、性能面で大きな向上が見られます。特に注目すべきはコンテキストウィンドウ(一度に処理できる情報量)が8,192トークンへと拡張され、前世代の4倍になった点です。これにより、最大で29枚の画像、58個のビデオフレーム、または5.5分間の音声をローカルハードウェアで直接処理できるようになりました。
ベンチマークにおいても高いスコアを記録しており、特にコード検索(MTEB Code)では、前世代の68.76から78.68へと約10ポイント向上したと報じられています。これにより、ローカル環境でのコードベースのインデックス作成や、セマンティックなコード検索に非常に適したモデルとなっています。
Google社は、10億パラメータ未満のマルチモーダル埋め込みモデルの中でトップレベルのスコアを達成しており、自社より2倍以上のサイズを持つ一部の特化型モデルを上回る性能を持つと説明しています。
今後の展望と利用環境
EmbeddingGemma 2は、生成AIモデルであるGemma 4と組み合わせることで、複雑なマルチモーダルデータを理解するオンデバイスRAG(検索拡張生成)パイプラインを実現できます。RAGとは、外部から取得した最新情報をLLM(大規模言語モデル)に与えて回答させる手法のことです。
また、Androidエコシステム向けの開発者向けに、NPU(ニューラル処理ユニット)による加速をサポートするML Kitの対応が数週間以内に提供される見通しであると報じられています。
なお、このモデルは100以上の言語をサポートしていますが、Google社は言語によってパフォーマンスが均一ではない可能性があると述べています。また、セーフティチューニングや出力のモデレーションは行われておらず、代わりにトレーニングデータへの対策が適用されているとのことです。
出典 Google The Decoder EmbeddingGemma 2: The Developer Guide Google launches EmbeddingGemma 2, an open multimodal embedding model for devices Google DeepMind Releases EmbeddingGemma 2, a 740M Open Multimodal Embedding Model Built on Gemma 4 – MarkTechPost DeepMind Debuts EmbeddingGemma 2, Mapping Five Modalities Into One Space – Unite.AI Google Releases EmbeddingGemma 2, an On-Device AI That Handles Audio and Video, Running on 567MB of Memory — BigGo Finance Bring multimodal semantic search to the edge with EmbeddingGemma 2
ピックアップ記事


