第3回では、生成したダンスの前半404フレーム、約16.83秒を選んだ。映像ができたので、次は音楽と歌声を合わせていく。
動画に音を入れるところまではできた。ただ、動きのタイミングを合わせることと、使いたい歌声を作ることは、それぞれ別の難しさがあった。
歌声は、Qwen TTSで作った初期版から、Google TTSの話し声を参照に作った採用版へ進んだ。今回は、残していた初期版と、新しく作ったGoogle版をダンス映像に合わせ、約15.83秒の動画で聞き比べる。
「あと少し早く」だけでは合わなかった
最初の位置合わせでは、動画を見て「あとこれぐらい早く」「あとちょっと早く」と伝えていた。けれど、全体を同じ量だけずらしても合わない。中盤の膝と終盤の腕では、ずれ方が違っていた。
そこで、合わせ方自体をAI側で工夫してほしいとお願いした。
保存済みの音と実際に処理へ使った音の開始位置には33.333ミリ秒の差があり、歌と伴奏をその分だけ前へ進めた。さらに映像の進み方を部分ごとに変え、膝の動きを約0.4秒遅らせ、終盤の腕は約0.12〜0.18秒早めた。元のフレームを選び直し、動きの順序と404フレームを保っている。
その後の動画では、前後0.5秒ずつを切った約15.83秒を使い、冒頭の0.5秒だけ音を消した。今回載せる二つも、この短いMVの全尺を使っている。
朗読は聴けても、歌にするのは難しかった
以前作ったTTSの声は、朗読としては聴けた。その声を参照にして、歌声を作る候補を繰り返し調整していった。
ただ、少しずつ変えてみても、最低限聴ける歌声には届かなかった。朗読は聴けても、歌にするのは難しかった。
声を変換して音声ファイルを作れることと、その歌声を動画へ使いたいと思えることには差があった。何度も候補を作っただけで、歌声ができたことにはできない。
残っていた古い音声を聴き直し、Qwen TTSで作った初期版を選んだ。今回は、この声からどこまで変わったかを聞き比べる。
Qwen TTSの初期版
Qwen TTSの初期版。保存していた音声を使った、約15.83秒の動画。
Google TTSの話し声を、SoulXで歌声へ変える
今回のGoogle版では、まずGoogle TTSのLedaで話し声を用意した。その原声から、声の高さの推移を表すF0を取り直し、音声とF0を参照にして、SoulX-Singer-SVCで歌声へ変換した。歌詞と旋律の基準には、元のボーカルを使っている。
Google TTSが担当したのは参照に使う話し声で、歌声にする工程はSoulXが担当している。できた歌声を全尺で取り出し、位置合わせと冒頭の無音処理をしたうえで、VCSLの伴奏と合わせた。
歌声単体と伴奏入りの二つを確認し、この新しい歌声を今回のGoogle版として採用した。この声で、動画と記事を先へ進める。
Google TTS由来の採用版
Google TTSのLedaの話し声を参照に、SoulXで歌声へ変換し、VCSL伴奏と合わせた採用版。約15.83秒の動画。
Qwenの初期版は、選んでおいた既存の音声を使っている。Google版は、新しく用意したLedaの原声から歌声を作り直したものだ。
伴奏も選び直した
伴奏は、ドラムとピアノの二楽器で用意した。最初のRoland音色で鳴らした版を残し、同じ音符とテンポのままVCSLでも鳴らして、伴奏だけを聞き比べた。
Rolandの方は、電子音の感じが強かった。VCSLは音はいいけれど、少しこもった感じがした。今回の実験に使う分にはどちらでも問題ないので、2番のVCSLを選んだ。Google TTS由来の採用版には、この伴奏を使っている。
歌声を選び、仕上げへ進む
最初は、声の候補を何度も作っても使いたいところに届かなかった。今回は、残していた初期版と新しく作った採用版を、短い区間だけでなく、約15.83秒の動画全体で確かめる形にした。
Google TTS由来の採用版の声で進める。ただ、声を選んだことと、動画全体が完成したことは分けている。
音楽と動きの最終的な位置合わせ、表情、歌詞に合う口の動きは、これから詰めるところがある。今回の動画は、歌声を選ぶまでの変化を残した制作途中の記録だ。
次の第5回では、Google TTSの話し声をどう用意し、歌声の参照に使ったかを、保存してある制作記録に沿って詳しく書いていく。
指定したダンスを作った工程は、第3回「Mioに指定したダンスを踊らせたい」にまとめている。