ホーム / ニュース / Google、マルチモーダル埋め込みモデル「EmbeddingGemma 2」を公開 音声・動画にも対応

Google、マルチモーダル埋め込みモデル「EmbeddingGemma 2」を公開 音声・動画にも対応

Google DeepMindは10月6日、端末上での利用を想定したオープンな埋め込みモデル「EmbeddingGemma 2」を公開した。テキストとコードに加えて、画像・音声・動画を1つの埋め込み空間に写像できるのが最大の変更点で、ライセンスはApache 2.0となっている。

パラメータ数は全体で7億4,000万。Gemma 4のアーキテクチャを土台に、テキスト処理を担う2億7,000万パラメータを中核とし、画像用(1億7,000万)と音声用(3億)のエンコーダーを必要に応じて組み合わせるモジュール構成をとる。コンテキスト長は8,000トークンで、1回の入力で約5.5分の音声、29枚の画像、または58フレームの動画を扱える。出力ベクトルは768次元が基本で、Matryoshka表現学習により512・256・128次元に切り詰めても使えるため、ベクトルデータベースの容量を最大6分の1まで抑えられる。

性能面では、コード検索のベンチマークMTEB Codeで78.68を記録し、初代の68.76から9.92ポイント伸ばした。多言語テキストの性能は初代と同等を維持している。音声のMAEBでは10億パラメータ未満のモデルで首位、画像のMIEB Liteでもより大型の専用モデルを上回ったという。量子化した状態でPixel 11 Pro上で動かした場合の使用メモリは、テキストのみで約191MB、全モダリティを有効にして約567MB。重みはHugging FaceとKaggleで配布され、Ollama、llama.cpp、vLLM、MLX、LM Studio、sentence-transformers、transformers.jsなどから利用できる。Vertex AI Model Gardenへの追加は近日中の予定だ。

2025年9月に公開された初代EmbeddingGemmaは、3億800万パラメータのテキスト専用モデルで、コンテキスト長は2,000トークンだった。今回は扱えるデータの種類と長さが大きく広がった一方、テキストだけを使う構成ではパラメータが2億7,000万と初代より小さく、メモリも200MB前後に収まる。社内文書と会議の録音、画面のスクリーンショットをまとめて端末内で検索するRAGを、データをクラウドに出さずに組める点が、初代からの実用上の変化になる。100以上の言語に対応した初代と多言語テキストの性能が同等とされているため、日本語の文書検索は初代と同じ水準で使えるが、日本語音声を対象にした検索精度は今回の発表では示されていない。

タグ付け処理あり: