Gemini 3.8:記述から声を生成・複製する新次元のAI音声技術
この動画では、Google DeepMindが開発した新しいテキスト読み上げモデル「Gemini 3.8」の機能を紹介しています。ユーザーはテキストで特徴を記述するだけで理想の声をデザインできるほか、既存の声を微調整したり、自身の声を安全に複製したりすることが可能です。クリエイティブな動画制作やナレーション作業を劇的に効率化するツールとしての側面が描かれています。
背景
動画は、新しいテキスト読み上げモデルのプロモーションビデオを制作するというシチュエーションで進行します。従来の音声合成技術を超え、一貫性があり表現力豊かな音声出力をオンデマンドで生成できることが強調されています。特に、特定のアクセントや感情、年齢層を指定して声を「デザイン」できる点や、1,000種類以上の膨大なボイスライブラリを備えている点が、このモデルの強力な基盤として示されています。
この動画の要点
1. 「Voice Design」機能により、テキストで詳細な指示を出すだけで新しい声を生成できます。動画内では「30代の女性、活気があり、ブルックリンアクセントで強調する」といった具体的なプロンプトから、複数の音声オプションが即座に提示される様子が示されています。
2. 「Remix it」機能では、既存の音声に対して「もう少し声を低くして」といった追加の指示を出すことで、キャラクターを維持したまま音質を調整できます。また、1,000種類以上の既成ボイスが用意されており、マッドサイエンティストや瞑想ガイドなど、多様なペルソナから選択可能です。
3. 「Voice Replication」機能により、自身の声を複製して利用できます。約20秒のサンプル録音と、本人であることを証明する同意文の読み上げというステップを経て、安全にカスタムボイスを作成できます。これにより、自分自身の声でテキストを読み上げさせることが可能になります。
なぜ重要か
Gemini 3.8の最大の特徴は、音声合成を「選択」から「創造」へと進化させた点にあります。単に用意されたリストから選ぶのではなく、クリエイターが頭の中で描いている「特定のキャラクター性」を言語化することで、それに合致する音声をゼロから生成できる柔軟性は、コンテンツ制作における表現の幅を大きく広げます。また、複数の声をタイムライン上で組み合わせるマルチスピーカーシーンの構築や、リミックスによる微調整機能は、プロフェッショナルな編集現場での実用性を強く意識した設計と言えます。さらに、音声複製における本人確認プロセスの導入は、AI音声の倫理的・安全な利用に対する配慮を示しており、技術の普及に向けた重要なステップとなっています。
こんな人におすすめ
動画クリエイター、ナレーター、ポッドキャスト制作に関わる方、および最新のAI音声合成技術に興味がある技術者。短時間で高品質かつ多様なナレーションを生成したいと考えている人に最適です。
見どころ
この記事は Google DeepMind が公開した動画をAI(Google Gemini)が視聴して 日本語にまとめ、公開前に運営者が内容を確認したうえで掲載しています。 要約の性質上、細部が元の発言と異なる場合があります。 正確な内容は元の動画をご確認ください。
YouTubeで元の動画を見る


