Mioの正面図を、前回と同じ5秒の条件で動かしてみた
目次(4 節)
第1回で作った15秒のMVは、15秒を一度に動画生成したものではない。Mioの背面寄りの絵から約5秒のカットを複数作り、使える2本を編集でつないだ。背面から正面へ向かせた別のカットでは、元絵にない服の前側が安定しなかった。
そこで今回は、Mio原案にある正面図を最初から渡してみた。第1回で採用した約5秒カットと生成設定をそろえ、入力画像の向きが変わると、どんな映像になるかを見た。
元の三面図から正面だけを取り出す
指定した元絵は「Mio原案.png」。左の正面、中央の側面、右の背面が1枚に入っている。生成時に複数の姿を同時に読ませないよう、左の正面だけを切り出した。背景を端の色で伸ばし、第1回の入力と同じ997×1577へ整えた。

今回指定した元画像。記事の実験には左側の正面図だけを使った。


第1回の採用5秒と、今回の5秒を並べる
比較の基準は、第1回で採用したshot02の生成元動画だ。出力を704×1280、24fps、121フレームにそろえた。プロンプト、seed、生成段階、サンプラーなど、動画生成グラフの設定はそのまま。変えたのは入力画像と、出力ファイル名だけだ。
正面図の動画では、カメラが寄る間、緑のトップスの胸元、腰の交差した帯、カーゴパンツ、顔、耳は大まかに保たれた。尾は前半に見えるが、終盤は画角から外れる。第1回の採用shot02も背面寄りのまま寄っていき、背中の開いた服を保っている。両方とも約5.04秒で、音声トラックも入っている。
見比べた私の印象では、正面図を渡したことで全体が大きく変わった、というほどの違いはなかった。一方、カメラの寄り方や切り取り方には違いが出た。今回はカットの仕方を新たに指定せず、前回の設定をそのまま使っている。正面のデザインを渡すことと、見せたい構図まで指定することは、別に考える必要がありそうだ。

正面図の映像、2.5秒付近。動画も上で再生できる。
この2本から言えること
正面を見せたいカットなら、正面の絵から始めると、元絵にある前側の服を入力として渡せる。今回の5秒でもそのデザインを大まかに追えた。一方、第1回の採用shot02はそもそも正面へ大きく回らない。今回も正面から背面へ回していない。この2本だけで「正面図に替えれば、どんな回転でも服が崩れない」とは言えない。
画像以外の生成グラフはそろえたが、実行環境は第1回のComfyUI 0.33.1から今回の0.37.3へ変わり、起動オプションも違う。今回の監督込み実行時間は59.935秒、GPU使用量の観測最大は31,510MiBだった。この時間を第1回の速度と直接比べてモデルの速さを論じない。最初の絵の向きと構図も違うため、1組の映像から一般的な優劣は決められない。
同じ正面図をMiniMax H3にも渡してみた
LTXだけを見ていると、別の動画モデルでも試したくなる。上と同じ997×1577の正面画像と、音の指定も含む同じ英文の正プロンプトをMiniMax H3にも渡した。出力は704×1280、24fps。H3は長さの単位が異なり124フレームになるので、生成原本を残したうえで、比較用には先頭121フレームを切り出した。
H3は白い背景の正面図から始まり、暗い作業場と緑・金色の光を作り足した。人物を比較的広く見せ、尾も終盤まで画面に入っている。LTXは途中から顔や上半身へ寄るので、同じ絵と文章からでも、画面の使い方が変わった。


H3でも、緑のトップス、腰の交差した帯、カーゴパンツ、耳や尾は大まかに追えた。一方、髪は途中からポニーテールとして描かれている。共通のプロンプトには、最初のMVで使った「blonde ponytail」という指定が残っていた。これは正面資料の髪形と一致しないので、髪の変化をモデルの参照能力だけの問題にはできない。
今回は1回ずつの実用比較だ。H3は20ステップ、LTXは2段階の8+3ステップで、サンプラーも異なる。H3の初期画像は出力寸法へ引き伸ばされ、LTXとは前処理が違う。LTXのnegative conditioningも、H3の今回の経路には独立した入力がない。H3とLTX初段のseedは同じ20260816だが、LTXの二段目は42で、同じ乱数による試験にはならない。画像と正プロンプト、出力寸法とfpsをそろえた範囲で、映像の違いを見ている。
H3の監督込み経過時間は257.129秒、GPU使用量の観測最大は20,579MiBだった。LTXは別の起動条件で生成しているため、ここから速度やメモリ効率の一般的な順位は決めない。
同じ正面資料を複数の画像生成モデルで作り直して見比べた結果は、今後投稿する補足編で紹介する予定だ。
続く第3回では、指定したダンスをMioに踊らせるまでの過程を書く予定だ。