rss_feed

詳細検索

expand_more
~
0
10000
最小
最大
Google、Gemini 3.8 Flash TTS・Gemini 3.8 Flash Lite TTSを発表。音声のカスタマイズや感情表現が進化

Google、Gemini 3.8 Flash TTS・Gemini 3.8 Flash Lite TTSを発表。音声のカスタマイズや感情表現が進化

Googleは、新たな音声生成AIモデル「Gemini 3.8 Flash TTS」と「Gemini 3.8 Flash-Lite TTS」を発表しました。

なお、本記事では「Gemini 3.8 Flash TTS」と「Gemini 3.8 Flash-Lite TTS」の2モデルを総称して「Gemini 3.8 TTS」と表記します。あらかじめご了承ください。

Gemini 3.8 TTSとは

Gemini 3.8 TTSは、入力されたテキストを自然な音声に変換するAIモデルです。

従来モデルからさらに機能が拡張され、話し方や感情、アクセントなどを細かく指定できるほか、テキストによるプロンプトからオリジナルの声を作成することも可能です。

今回発表されたのは、音声品質と表現力を重視した「Gemini 3.8 Flash TTS」と、処理速度やコスト効率を重視した「Gemini 3.8 Flash-Lite TTS」の2モデルです。

モデル主な特徴
Gemini 3.8 Flash TTS高品質な音声生成、細かな感情表現、長時間のナレーションに対応
Gemini 3.8 Flash-Lite TTS低遅延とコスト効率を重視。大量の音声コンテンツ制作や音声エージェント向け

両モデルは共通のAPI形式を採用しており、開発者は用途に応じてモデルを切り替えられます。

また、日本語を含む多言語に対応しており、Flash TTSは130言語、Flash-Lite TTSは101言語をサポートしています。

オリジナルの声を作成可能に

Gemini 3.8 TTSでは、あらかじめ用意された音声を選ぶだけでなく、自然言語による指示から新しい声を生成できます。

例えば、落ち着いた声のナレーターや、独特なアクセントを持つキャラクターなど、用途に合わせた音声を設計することが可能です。

また、既存の音声を再現するボイスレプリケーションにも対応しています。約30秒の音声サンプルを使用して、特定の人物の声の特徴を再現できます。

ただし、音声の複製には、本人の声または利用する権利を持つ音声を使用する必要があります。また、本人の同意を確認するための仕組みも導入されています。

作成した音声は保存・管理できるため、同じキャラクターやナレーターの声を複数のコンテンツで継続的に利用することも可能です。

これにより、オーディオブックやポッドキャスト、ゲームのキャラクターボイスなど、さまざまな制作現場での活用が期待されます。

感情表現や話し方を細かく制御

Gemini 3.8 TTSでは、音声の生成時に話し方や感情表現を指定することもできます。

例えば、落ち着いた口調で話す場面や、興奮した様子で話す場面など、文章の内容に合わせて発話スタイルを調整できます。

また、会話中の笑い声やため息、短い間などを取り入れた、よりリアルな音声生成にも対応しています。

複数話者による会話では、それぞれの声を区別しながら発話を生成できるため、ポッドキャストやドラマ形式の音声コンテンツ制作にも利用できます。

さらに、長いナレーションや複数人による会話であっても、声質や音量、話し方の一貫性を維持できるよう設計されています。

Google AI StudioやGemini APIで利用可能

Gemini 3.8 TTSは、Google AI StudioおよびGemini APIを通じて利用できます。

Google AI Studioには音声生成用のインターフェースが用意されており、オリジナルの声の作成や音声の複製、複数話者による会話の編集などを試すことができます。

また、Gemini APIを利用することで、開発者は自社サービスやアプリケーションに音声生成機能を組み込むことも可能です。

さらに、Gemini 3.8 Flash TTSはGemini Notebook、Gemini 3.8 Flash-Lite TTSはGoogle Vidsでも提供されます。

企業向けのGemini Enterpriseでは、APIを通じた提供が近日中に開始される予定です。

Gemini 3.8 TTSのAPI料金

Gemini APIでは、両モデルに無料枠と有料枠が設けられています。

2026年9月24日時点で公開されている標準利用料金は、以下のとおりです。

モデル入力100万トークン音声出力100万トークン
Gemini 3.8 Flash TTS$0.50$9.00
Gemini 3.8 Flash-Lite TTS$0.50$6.00

上記は2026年12月31日までの料金です。Googleの料金表では、2027年1月1日以降、入力料金が100万トークンあたり1ドル、音声出力料金がFlash TTSで18ドル、Flash-Lite TTSで12ドルになると案内されています。

なお、無料枠については利用制限が適用されるため、無制限に音声を生成できるわけではありません。

AIが生成した音声を識別する仕組みも導入

音声生成技術の高度化に伴い、AIによって作成された音声の悪用を防ぐための仕組みも重要になっています。

Googleは、Geminiの音声生成モデルによって作成された音声に、AI生成コンテンツを識別するための電子透かし技術「SynthID」を導入しています。

人間の耳では認識できない電子透かしを音声データに埋め込むことで、対応する検証技術を用いてAIが生成した音声かどうかを確認できます。

また、音声の複製機能には本人の同意確認に加え、コンテンツの来歴を示す「C2PA」にも対応した仕組みが導入されています。

これらの仕組みにより、AIが生成した音声の識別や、音声の権利者・利用者を保護するための対策が講じられています。

Gemini 3.1 Flash TTS以来、約5か月ぶりのアップデート

今回のGemini 3.8 TTSは、2026年4月に発表された「Gemini 3.1 Flash TTS」以来、約5か月ぶりとなる音声生成モデルのアップデートです。

従来モデルから音声の自然さや表現力がさらに向上したほか、新たにオリジナルの声の作成や、既存の声を再現する機能などが追加されました。

Googleは9月に入ってから、Gemini 3.8 FlashやGemini 3.8 Liveなど、Geminiファミリーの新モデルを相次いで発表しています。

今後は、Gemini 3.5 ProやGemini 4など、次世代モデルの動向にも注目が集まりそうです。

情報元

コメントを投稿する

メールアドレスが公開されることはありません。 ※ が付いている欄は必須項目です