Qwenの3構成で同じシューティングゲームを作った。生成時間と、遊べるまでの違い

目次(6 節)

いろいろなローカルAIが「良い」と紹介されているけれど、自分の環境で動かしたらどうなるのか。近いモデルサイズの候補から、普段使いに向くものを確かめたかった。

そこで2026年10月3日、手元のRTX 5090で動くQwenの3構成へ、同じシューティングゲーム制作課題を渡した。初回に加えて、共通の修正指示を2回ずつ出している。

生成時間はFlash Nextが各段階で最短だった。ただし、AIが出したままの版は3構成とも必須機能に不具合が残った。 遊び比べられるよう、Codexが補修した版も別に用意した。下の体験では、補修版とAI原版を切り替えて違いを確かめられる。

やってみた理由

モデルの評判や生成速度の数字だけでは、手元でどれくらい待つのか、返ってきたものがどこまで使えるのかは分からない。普段使いなら、返答の速さと、直す手間の両方が気になる。

そこで、同じシューティングゲームを作る課題で比べることにした。スタート、移動、射撃、得点、一時停止、再開まで実際に触れば、出来上がりの違いも確認できる。読者にも、その違いを遊びながら知ってもらいたい。

今回は一つの課題での制作記録として、生成にかかった時間と、出来上がったものの動作を分けて残した。AI全般のランキングや、量子化だけの優劣を決める実験ではない。

やったこと

比較したときの環境

今回の比較は、2026年10月3日時点の手元のPCで行った。あとで環境が変わっても、このとき何を使っていたか分かるように残しておく。

項目構成
CPUIntel Core i5-13500
OS・実行基盤Windows 11、WSL2(Ubuntu 24.04)、Docker
GPUNVIDIA GeForce RTX 5090(VRAM 32GB)
メモリ64GB級。当日の記録では63.7GiB
共通の入口Windows側のQwen Code CLI 0.21.15
Q5・Q4の推論WSL2上のDockerで動くOllama 0.34.0
Flash Nextの推論Windows版Strata Engine 0.1.30、MTPあり

GPU・メモリ・実行ソフトのバージョンは当日の保存記録で確認した。CPUとOS・実行基盤の構成は既存の環境メモによるもので、今回の生成ログでは再取得していない。

比較した3構成

Qwen Code CLI 0.21.15を共通の入口にして、ブラウザーで動くスマートフォン対応のシューティングゲームを作らせた。比較したのは次の3構成だ。

ページ上の名前ローカルで使用した構成推論エンジン
Unsloth Q5Qwen3.8 27B / UD-Q5_K_XLOllama
Q4_K_MQwen3.8 27B / Q4_K_MOllama
Flash NextQwen3.8 Flash Next / IQ2_XSStrata

モデル名は今回のローカル環境での識別名。Q5とQ4は同じ27B系でも量子化が異なり、Flashはモデル構造と実行エンジンも異なる。近いサイズの候補から普段使いを選ぶのが目的だが、3構成を完全に同じ条件にそろえた比較ではない。

Ollamaの登録情報ではQ5とQ4はどちらも27.3Bだった。Q5の「UD-Q5_K_XL」は使用したモデルのタグ表記で、Ollama API上の量子化情報はunknownとなっていた。また、両方のGGUF内部の構造名はqwen35だった。ここでは保存した識別名を使い、モデル名から別の世代や性能を推定していない。

Q5・Q4とFlashを同時に推論させず、同じGPUで順番に実行した。Flashは開始時点でロード済みだったため、起動からの条件まで完全に同じではない。この違いも含めた「自分の環境での3構成」の記録として見てほしい。

初回の課題は同じ内容にそろえ、各段階1回のAPI要求で生成した。ツール実行、MCP、hooksは無効にしている。AIがファイルを自律的に編集する開発比較ではなく、CLI経由でコードを生成し、Hostが保存する比較だ。

要求した設定は、出力上限8,192 token、32K context、temperature 0.6、top_p 0.95、seed 42、thinking off。修正では3構成に同じ追加指示を渡したが、各自の前版HTMLも入力するため、文脈全体は同一ではない。Q5の修正1回目は初回の完成HTMLがなく、共通仕様からの作り直しになった。

結果:数字を見て、実際に遊ぶ

まずは「プレイ用(Codex補修)」を選んで遊んでみてほしい。同じシューティングの課題でも、画面の構成や動きに違いがある。比較するモデルと版を変えると、今のゲームは停止して入れ替わる。

記事の幅では操作しづらい場合は、試遊ページを広い画面で開く。PCはゲーム画面をクリックしてから矢印キーやWASD、タッチでは画面内の操作を使う。射撃は自動。操作方法の細部は各ゲームの説明を見てほしい。

生成にかかった時間

次の時間は、CLIを開始してから終了するまでの実測だ。モデルのロードや入出力処理を含んでいる。

構成初回共通修正1共通修正23段階の合計
Unsloth Q5170.71秒98.56秒89.57秒358.84秒
Q4_K_M125.24秒123.05秒123.50秒371.79秒
Flash Next35.90秒33.07秒38.99秒107.95秒

合計欄は、初回と2回の修正にかかった時間を足したものだ。表では小数第2位まで表示しているため、各欄の数字を足すと、合計欄と0.01秒ずれる場合がある。

これは完成までの総時間ではない。 全構成で不具合が残った3段階のCLI時間で、動作検査やCodexの補修時間を含まない。

Flashは初回開始時にロード済みで、Q4とQ5はロード時間を含んでいる。初回のロードはQ4が14.20秒、Q5が17.79秒だった。待ち時間の違いにはこの条件差も含まれる。

初回のモデル生成中のdecode速度は、Q5が61.6、Q4が70.3、Flashが166.9 token/秒だった。この値はサーバーの生成時間から計算したもので、CLI全体の速度や、ゲーム完成の速さと同じ意味ではない。出力token数も8,192・7,582・4,860と異なる。

AI原版に残った不具合

構成初回共通修正2回後のAI原版
Unsloth Q58,192 tokenの上限に到達し、完成HTMLなし開始・敵・射撃・得点は動くが、プレイ中も開始説明カードが中央の視界を覆う
Q4_K_M開始・敵・射撃・得点は動く。一時停止クリックに不具合クリックによる停止・再開と、横向き画面の操作表示に不具合が残る
Flash NextHTMLは完成するが、スタート後も待機状態修正2回後も、スタート操作でゲームを開始できない

Q4は修正1と修正2のHTMLがSHA-256まで完全に一致した。なぜ修正が反映されなかったかは、今回の記録だけでは分かっていない。

Q5初回は完成HTMLがなく、旧adapterでは途中のコードも保存できなかった。この版は体験の選択肢を無効にしており、後から補ったゲームを初回の成果として扱ってはいない。

うまくいった点

生成時間だけでなく、原版と補修版を残したことで、「速く返ってきたコード」と「実際に操作できる作品」を分けて見られるようになった。

保存した生成記録は3構成×3段階の9回。完成したAI HTMLは8版で、それとは別にCodexの補修版を3版保存している。体験できるHTMLは合計11版だ。

補修版では、3作品ともPCと小さな画面での開始・移動・射撃・得点・停止・再開、画面サイズ変更を確認した。PCでは自然なゲーム終了とリスタートも確認している。AI原版を完成扱いするための補修ではなく、読者が遊べる体験として、変更者を明示した別版にした。

失敗・課題:補修が入ったところ

プレイ用の版Codexが補修した主な部分
Unsloth Q5プレイ中の説明カード非表示、画面の余白、入力解除、複数のタッチへの対応、敵などの個数上限
Q4_K_M描画と入力の座標変換、画面消去、停止・再開の操作、入力解除、敵弾と個数上限
Flash NextCanvasだけでのポインター捕捉、開始・停止・再開の入力、追加の指を無視する処理、操作欄の高さが変わる際の描画サイズ追従

補修版は各AIのコードやデザインを土台にしているが、Codexの変更が入っている。補修版で遊べることを、そのモデルが自力で完成させた証拠にはしない。 Codexの作業時間はそろった条件で測っていないため、モデルの速度比較にも加えていない。

また、今回の試行は1課題・各段階1回だけ。モデル構造、量子化、推論エンジン、FlashのMTP(複数tokenを先読みする仕組み)も異なるので、「Q5よりQ4が必ず速い」「このAIがいつでも最も優秀」といった一般化はできない。

小さな画面の検査は、PCブラウザーで360×800・390×844・844×390を再現して行った。実スマートフォンのSafariやChrome、実機での画面回転、長時間の安定性、衝突判定の細部までは未検証だ。PCでの描画間隔をスマホのFPSとしては載せていない。

普段使いに向けて

AIが2回修正した最後の版を見て、出来を重視するなら、今回はQ5を一番に評価したい。 開始・移動・射撃・得点に加えて、停止・再開まで動いていた。プレイ中に説明カードが中央に残る問題はあるが、この課題では完成に近かったと考えている。

Q4もゲームとしては動いたが、クリックでの停止・再開や横画面に不具合が残った。Flashは待ち時間が短い一方、修正2回後も開始できなかった。速くコードが返ってくることと、返ってきたものがそのまま使えることは、分けて考える必要があった。

ただし、これは一つのゲーム課題での暫定的な評価だ。AI原版は3構成とも完成とはいえず、今遊べる「プレイ用(Codex補修)」にはCodexの手直しが入っている。補修後の出来を、そのまま各モデルの実力順位にはしない。

普段使いなら短い待ち時間は魅力だが、今回のゲーム制作だけで最適なモデルを決めるには足りない。返ってきたコードを直す手間も含めて考えたい。

今回の結果からは、Q5を普段使いの有力な候補にしたい。次は候補を一つに絞り、しばらく同じモデルに固定して使ってみる。日々の依頼で、待ち時間と修正の手間が納得できるかを確かめる。現時点では、固定するモデルの決定や継続使用の結果までは出ていない。

体験では、補修版を一つ遊んだ後に「AI修正2回目」へ切り替えると、どの部分を直したのかを確かめやすい。見た目だけでなく、スタートや一時停止を実際に押してみてほしい。

環境づくりの話はRTX 5090でローカルAI環境を構築した記録、ブログ制作の話はWordPressからAstroへ置き換えた記録にまとめている。