ホーム / ニュース / Google、感情表現を制御できる新音声合成モデル「Gemini 3.8 TTS」を発表

Google、感情表現を制御できる新音声合成モデル「Gemini 3.8 TTS」を発表

Googleは9月23日、新しいテキスト音声合成(TTS)モデル「Gemini 3.8 Flash TTS」「Gemini 3.8 Flash-Lite TTS」を発表した。ゲームやオーディオブック向けの創作的な音声制御に強い前者と、吹き替えや音声エージェントなど大規模処理向けに最適化した後者の2モデル構成になる。

両モデルは自然言語のプロンプトから新しい声をゼロから作成できるほか、30秒程度の音声サンプルから声を複製する機能や、2000種類以上の既製ボイスライブラリへのアクセスも備える。100以上の言語・方言に対応し、せりふ単位で声色やペース、感情を細かく指定できるため、数時間規模の長尺コンテンツや2話者の対話シーンにも使えるとしている。音声にはAI生成物と識別できる電子透かし「SynthID」を埋め込み、声を複製する際には本人の同意確認を求めるなど、悪用防止の仕組みも組み込んだ。

音声の自然さを測るHume AIの「Voice Design Benchmark」では71.4ポイントで首位となり、日本語やブラジルポルトガル語、ベトナム語など主要言語別の評価でも上位に入ったという。開発者向けにはGemini APIとGoogle AI Studioで提供が始まっており、企業向けのGemini Enterprise APIでの提供も近く予定されている。一般向けにはFlash版がGemini Notebook、Flash-Lite版がGoogle Vidsでそれぞれ利用できる。Agora、LiveKit、Pipecat、Vercelなど複数の開発者プラットフォームでの統合も予定されており、料金体系は発表時点では明らかにされていない。

タグ付け処理あり: