Mioの歌声を選ぶ。Qwen TTSの初期版からGoogle TTS由来の採用版へ

目次(5 節)

第3回では、生成したダンスの前半404フレーム、約16.83秒を選んだ。映像ができたので、次は音楽と歌声を合わせていく。

動画に音を入れるところまではできた。ただ、動きのタイミングを合わせることと、使いたい歌声を作ることは、それぞれ別の難しさがあった。

歌声は、Qwen TTSで作った初期版から、Google TTSの話し声を参照に作った採用版へ進んだ。今回は、残していた初期版と、新しく作ったGoogle版をダンス映像に合わせ、約15.83秒の動画で聞き比べる。

「あと少し早く」だけでは合わなかった

最初の位置合わせでは、動画を見て「あとこれぐらい早く」「あとちょっと早く」と伝えていた。けれど、全体を同じ量だけずらしても合わない。中盤の膝と終盤の腕では、ずれ方が違っていた。

そこで、合わせ方自体をAI側で工夫してほしいとお願いした。

保存済みの音と実際に処理へ使った音の開始位置には33.333ミリ秒の差があり、歌と伴奏をその分だけ前へ進めた。さらに映像の進み方を部分ごとに変え、膝の動きを約0.4秒遅らせ、終盤の腕は約0.12〜0.18秒早めた。元のフレームを選び直し、動きの順序と404フレームを保っている。

その後の動画では、前後0.5秒ずつを切った約15.83秒を使い、冒頭の0.5秒だけ音を消した。今回載せる二つも、この短いMVの全尺を使っている。

朗読は聴けても、歌にするのは難しかった

以前作ったTTSの声は、朗読としては聴けた。その声を参照にして、歌声を作る候補を繰り返し調整していった。

ただ、少しずつ変えてみても、最低限聴ける歌声には届かなかった。朗読は聴けても、歌にするのは難しかった。

声を変換して音声ファイルを作れることと、その歌声を動画へ使いたいと思えることには差があった。何度も候補を作っただけで、歌声ができたことにはできない。

残っていた古い音声を聴き直し、Qwen TTSで作った初期版を選んだ。今回は、この声からどこまで変わったかを聞き比べる。

Qwen TTSの初期版

Qwen TTSの初期版。保存していた音声を使った、約15.83秒の動画。

Google TTSの話し声を、SoulXで歌声へ変える

今回のGoogle版では、まずGoogle TTSのLedaで話し声を用意した。その原声から、声の高さの推移を表すF0を取り直し、音声とF0を参照にして、SoulX-Singer-SVCで歌声へ変換した。歌詞と旋律の基準には、元のボーカルを使っている。

Google TTSが担当したのは参照に使う話し声で、歌声にする工程はSoulXが担当している。できた歌声を全尺で取り出し、位置合わせと冒頭の無音処理をしたうえで、VCSLの伴奏と合わせた。

歌声単体と伴奏入りの二つを確認し、この新しい歌声を今回のGoogle版として採用した。この声で、動画と記事を先へ進める。

Google TTS由来の採用版

Google TTSのLedaの話し声を参照に、SoulXで歌声へ変換し、VCSL伴奏と合わせた採用版。約15.83秒の動画。

Qwenの初期版は、選んでおいた既存の音声を使っている。Google版は、新しく用意したLedaの原声から歌声を作り直したものだ。

伴奏も選び直した

伴奏は、ドラムとピアノの二楽器で用意した。最初のRoland音色で鳴らした版を残し、同じ音符とテンポのままVCSLでも鳴らして、伴奏だけを聞き比べた。

Rolandの方は、電子音の感じが強かった。VCSLは音はいいけれど、少しこもった感じがした。今回の実験に使う分にはどちらでも問題ないので、2番のVCSLを選んだ。Google TTS由来の採用版には、この伴奏を使っている。

歌声を選び、仕上げへ進む

最初は、声の候補を何度も作っても使いたいところに届かなかった。今回は、残していた初期版と新しく作った採用版を、短い区間だけでなく、約15.83秒の動画全体で確かめる形にした。

Google TTS由来の採用版の声で進める。ただ、声を選んだことと、動画全体が完成したことは分けている。

音楽と動きの最終的な位置合わせ、表情、歌詞に合う口の動きは、これから詰めるところがある。今回の動画は、歌声を選ぶまでの変化を残した制作途中の記録だ。

次の第5回では、Google TTSの話し声をどう用意し、歌声の参照に使ったかを、保存してある制作記録に沿って詳しく書いていく。

指定したダンスを作った工程は、第3回「Mioに指定したダンスを踊らせたい」にまとめている。