Google、次世代音声AI「Gemini 3.1 Flash TTS」 自然言語で表現を制御可能に

ITmedia AI+ / 4/16/2026

📰 NewsDeveloper Stack & InfrastructureTools & Practical UsageIndustry & Market MovesModels & Research

Key Points

  • Googleが自然な音声を生成するTTSモデル「Gemini 3.1 Flash TTS」を発表し、Gemini API / AI Studio、Vertex AI(企業向けプレビュー)、Google Workspace(Google Vids経由の一部機能)で提供する。

 米Googleは4月15日(現地時間)、自然な音声を生成するAIテキスト読み上げモデル「Gemini 3.1 Flash TTS」(TTSはText-to-Speechの略)を発表した。開発者向けには「Gemini API」および「Google AI Studio」で、企業向けには「Vertex AI」でプレビュー提供されるほか、Google Workspaceユーザーも「Google Vids」を通じて一部の機能を利用できる。

 tts 1 (画像:Google)

 ユースケースとしては、開発者や企業、一般ユーザーによる次世代のAI音声アプリの構築などが挙げられる。新たに導入された「音声タグ」機能により、自然言語のコマンド(「ゆっくり話す」「ささやくように」など)をテキストに直接埋め込むことで、声のスタイルや話すペース、表現方法を細かく制御できるのが特徴だ。これにより、日本語を含む70以上の言語で、複数話者による自然な会話劇の設定や、表現力豊かで没入感のある音声体験を作り出せるとしている。

 tts 2 Vertex AIで音声タグを使う(画像:Googleの動画より)

 ベンチマークでは、人間のブラインドテストによる好みを集計した「Artificial Analysis TTS」リーダーボードで1211という高いEloスコアを記録した。さらに、高品質な音声生成能力と低コストという理想的なバランスを両立しているとして、同ベンチマーク内で「most attractive quadrant」(最も魅力的な象限)に位置づけられるなど、高い評価を受けている。

 tts 3 「Artificial Analysis TTS」結果(画像:Google)

 安全性の面では、このモデルで生成されたすべての音声に電子透かし技術「SynthID」が適用される。人間の耳には聞こえない透かしを音声データに直接埋め込むことで、AI生成コンテンツであることを確実に検出し、誤情報の拡散を防ぐ仕組みとなっている。これに加えて、GoogleのAI原則や安全に関するポリシーに基づき、開発段階から社内チームによる安全性評価やレッドチーム演習を実施しているという。

関連記事

関連リンク

Copyright © ITmedia, Inc. All Rights Reserved.

続きを読むには、コメントの利用規約に同意し「アイティメディアID」および「ITmedia AI+メールマガジン」の登録が必要です