Mioに指定したダンスを踊らせたい。元の絵に戻り、7つに分けて作った

(更新: )
目次(3 節)

第1回で1枚絵を動かしてみたので、次はMioにダンスを踊らせたくなった。ネットで見た紹介動画では、わりと簡単にできそうに見える。実際、何かを踊っている動画を作るところまでは、思ったより簡単だった。

難しかったのは、Mioの姿を保ったまま、自分が指定したダンスを踊らせることだった。動けばいいわけでも、似た人物が踊ればいいわけでもない。この違いで、ずいぶん試行錯誤することになった。

ここで振り返るのは9月17〜27日の試行錯誤。第2回の正面図実験と画像モデル比較の補足編は、採用版ができた後に追加した検証だ。読む順番と、実際に作った順番は分けている。

ダンスはできても、Mioにならない

参照画像を渡しても、うまく参照されず、全然違う絵になることがあった。Mioに似た立ち絵を作り直す案も試したけれど、服が近くても顔や線が変わってしまう。

例えば、9月17日にWan 2.2の別経路で作った6秒の動画がこれだ。

9月17日の不採用動画。Wan 2.2、480×832、24fps、6秒。

金色の髪は緑色のボブになり、尾の色も変わった。元の2Dの絵より、立体の人形に近い見え方になっている。動きは続いていても、これをMioの動画として使うことはできなかった。

さらに9月24日、短い統合候補でも顔や姿を保てず、不採用にした。

9月24日に不採用にした統合候補。480×848、25fps、3.2秒。確認用に音声を外しています(映像は元のまま)。

このときは「前回の画像はどこへ行った?」と感じた。動きは確認できたものの、Mioの見た目に加え、手や腕、口と歌詞の合わせ方にも問題が残った。二つは入力や生成経路も異なる実験で、同じモデルの条件違いを比べた動画ではない。ここでは、指定したダンスを作るまでに何が失敗したかを残しておきたい。

AIと相談しながら直していったが、そこでも別の難しさがあった。うまく動画にできないと、途中に静止画を入れる案などが出てきて、話が少しずつ違う方向へ進んでいく。私は指定したダンスを動画で見たい。その目的へ戻すやり取りにも、かなり手間がかかった。

採用した工程では、新しく似た絵を描かせるのをやめ、元のキャラクターシートから参照画像を直接切り出した。シート全体と、正面、顔、斜め、側面、背面の5枚を使った。

ダンス制作で使ったキャラクターシートから切り出したMioの正面

ダンス制作に渡した正面の参照画像。第2回の緑の衣装の正面図とは別の資料だ。

ダンス動画を、動きの参照にする

指定した動きを伝えるため、ダンス動画を参照にした。採用したのは、MiniMax H3のReference to Video。キャラクターの画像とダンス動画を一緒に渡し、Mioの姿でその動きを再現させる方法だった。

この工程では、ダンスを3Dの骨格データとして取り出して使ったわけではない。動画そのものを動きの参照にしている。生成はRTX 5090で行った。

約33.64秒の参照動画を連続する7区間に分け、それぞれを生成して順番につないだ。結果は24fps、800フレームで約33.33秒になった。長い1本を一度に仕上げるより、短い区間ごとに人物と動きを確かめながら進められた。

繰り返しに見えるダンスを読み違えた

途中で、ダンスが繰り返しているように見える部分をきちんと把握していなかった。使いたい区間と指定する秒数がずれ、確認し直すことにも時間を使った。

元動画を見直すと、前半と後半は別バージョンの振付だった。今回は前半を使うことにして、つないだ動画の先頭404フレームを選んだ。24fpsなので、長さは約16.83秒になる。

生成したダンスから選んだ前半16.83秒。音楽と動きの位置合わせをする前の無音映像。

当初考えていた約30秒から短くなったのは、使う振付の範囲を選び直したためだ。ここまでで、ようやく「Mioに指定したダンスを踊らせる」ための映像ができた。

ただ、映像ができても、音楽に合っているかは別に確認する必要があった。次の第4回では、「あと少し早く」と指示するところから、AIに位置合わせを任せるまでを書いていく。