Googleは9月24日、音声対話モデルGemini 3.8 Liveに映像のアバターを組み合わせた「Gemini 3.8 Live with Live Avatar」を発表した。ユーザーの声や映像を受け取りながら、画面上の人物が口の動きと表情を合わせてほぼリアルタイムに応答する仕組みで、企業の顧客対応窓口などへの組み込みを想定している。
アバターは発話に合わせたリップシンクと表情の変化、相手の発言を待って話し出すターンテイキングを備える。会話の途中で別の言語に切り替えても映像が乱れないとしており、対応言語は97。予約確認のような外部ツールの呼び出しはバックグラウンドで非同期に実行され、その間も会話は途切れない。企業は参照画像からブランドに合わせた独自アバターを作れるが、この機能は許可リストに登録された企業だけが使える。出力される音声と映像にはすべて、AI生成物であることを検出できる電子透かしSynthIDが埋め込まれる。
提供先はGemini EnterpriseとGoogle CloudのAgent Platform Studio、および開発者向けAPIで、一般向けのGeminiアプリでは使えない。用途の例としてはカスタマーサービス、操作手順の対話形式での案内、ホテルのチェックイン受付が挙がっている。料金やモデルID、応答遅延の具体的な数値は発表時点で公開されていない。
土台となるGemini 3.8 Liveは9月15日に発表されたばかりのモデルで、そのときは音声での対話とカメラ映像の読み取りが中心だった。97言語の自動切り替え、会話を止めないバックグラウンド処理、SynthIDの透かしは当時から備わっており、今回はそこに「話す側の映像」を足した形になる。当時のLive Extended ThinkingはArtificial AnalysisのSpeech to Speech Quality Indexで82.6を記録し首位とされていたが、アバター版がどちらのモデルを使うかは明記されていない。競合を見ると、OpenAIが9月10日にAPIで公開したGPT-Live-1はカスタム音声や電話回線への接続を打ち出した音声専用のモデルで、自前の映像アバターは持たない。音声AIをそのまま画面上の「受付係」として出せる点が、現時点でのGoogleとの違いになる。一方、日本語が97言語に含まれるか、日本のGoogle Cloudリージョンで使えるかは発表からは読み取れない。





