第4回では、Google TTSの話し声を参照にした歌声を選んだ。今回は、Google AI Studioで声を作り、それを曲の歌声に変えるまでの順序を書いていく。
Gemini TTSの話し声を聞いたとき、その出来に驚いた。Mioにも使えないかと試したけれど、自然に話せる声を作ることと、その声で曲を歌わせることは別だった。
まずは短い朗読例と、Gemini TTSへ直接歌うよう指示した試作を聞いてから、MVに使った歌声の作り方へ進む。
Ledaを選んで話し声を作る
話し声は、Google AI StudioのTTS画面で作った。画面を開いてからの操作は、この順序だ。
- 作成画面を開き、声を選ぶ。 「Create new dialog」で新しい入力欄を開く。「Speaker settings」の声のカードを開き、検索欄へ「Leda」と入力して選ぶ。Youthful、Higher pitchと表示される声を使った。
- 台本と話し方を入れる。 一つの「Speech block」へ読み上げる文章を入力する。「Style」を開き、どう話してほしいかを書く。今回は、自然な標準日本語、明るく親しみのある成人女性の声、会話程度の速さ、明瞭な子音を指定。背景音や音楽は加えず、声だけにした。
- 生成して保存する。 「Run」で音声を作り、プレーヤーで再生して確認する。「Download」からWAVを保存すれば、歌声変換のソフトへ渡す音声が用意できる。
Styleへ書く内容は、たとえば「自然な標準日本語で、明るく親しみのある成人女性の声。会話程度の速さで、子音は明瞭に。背景音や音楽を加えず、声だけを出してください」という形だ。
文章を入れるだけでなく、どう話してほしいかも文章で指定できる。元のMio音声をGoogleへ渡して声を複製したのではなく、Ledaの声と話し方の指定を使っている。
吾輩は猫であるの冒頭で声を聞く
話し方を聞く例として、夏目漱石の『吾輩は猫である』の冒頭を、新しく読ませてみた。
吾輩は猫である。名前はまだ無い。
この始まりから「記憶している。」までを読む、約14秒の短い音声だ。文章は青空文庫の『吾輩は猫である』を使った。
これは記事用の試聴例で、MVの歌声変換に使った参照音声とは別のものだ。歌声の制作には、保存してあったLedaの話し声を使っている。
Gemini TTSに直接歌わせてみる
話し声だけでなく、Gemini TTSへ直接歌うよう指示した試作も残してある。同じLedaで、短い日本語のフレーズを、伴奏なしの女性ポップスのアカペラとして歌うよう指定した。
この試作では、元曲の旋律や音符の時刻を渡していない。「歌って」と指示して音声が出たことと、指定した曲を、そのタイミングどおりに歌えたことは違う。MVには使わず、話し声を別のソフトで歌声へ変える方法に進んだ。
話し声をSoulXで歌声に変える
MVの歌声を作ったのは、SoulX-Singer-SVCという歌声変換のソフトだ。Google TTSのWAVを、そのまま曲へ重ねたわけではない。
- Ledaの話し声を、声質の基準にする。 どんな声で歌うかを決める参照音声として入れる。
- 元歌のボーカルを、歌詞と旋律の基準にする。 曲から分離したボーカルを使い、歌う内容と音の動きを渡す。
- 歌声を変換する。 話し声からも声の高さの情報を取り、SoulXでMVに使う区間の歌声を作る。生成した歌声を、MVの時間位置と長さに合わせた。
このように、話し声は「声質」、元歌のボーカルは「歌詞と旋律」という役割で使い分けた。
以前に調整したMioと同じ声質へ、十分に合わせ込めたわけではない。それでも、この声を参照にした歌声で進めることにした。
伴奏を合わせて映像の中で聞く
最後に、できた歌声をドラムとピアノの伴奏に合わせた。音色は第4回で選んだVCSLを使い、映像と同じ約15.83秒にまとめている。
Gemini TTSで話し声を作り、WAVとして保存する。その声をSoulXの参照にして、元歌の歌詞と旋律に沿う歌声へ変える。今回はこの順序で、MVに使う声を作った。
ダンス映像と合わせた結果は、第4回のQwen TTS初期版とGoogle TTS由来の採用版で聞き比べられる。音楽と動きの最終的な位置合わせや表情には、まだ詰めるところが残っている。歌詞に口の動きを合わせる調整は、ここでやめることにした。