Qwenの3構成で同じシューティングゲームを作った。生成時間と、遊べるまでの違い
目次(6 節)
いろいろなローカルAIが「良い」と紹介されているけれど、自分の環境で動かしたらどうなるのか。近いモデルサイズの候補から、普段使いに向くものを確かめたかった。
そこで2026年10月3日、手元のRTX 5090で動くQwenの3構成へ、同じシューティングゲーム制作課題を渡した。初回に加えて、共通の修正指示を2回ずつ出している。
生成時間はFlash Nextが各段階で最短だった。ただし、AIが出したままの版は3構成とも必須機能に不具合が残った。 遊び比べられるよう、Codexが補修した版も別に用意した。下の体験では、補修版とAI原版を切り替えて違いを確かめられる。
やってみた理由
モデルの評判や生成速度の数字だけでは、手元でどれくらい待つのか、返ってきたものがどこまで使えるのかは分からない。普段使いなら、返答の速さと、直す手間の両方が気になる。
そこで、同じシューティングゲームを作る課題で比べることにした。スタート、移動、射撃、得点、一時停止、再開まで実際に触れば、出来上がりの違いも確認できる。読者にも、その違いを遊びながら知ってもらいたい。
今回は一つの課題での制作記録として、生成にかかった時間と、出来上がったものの動作を分けて残した。AI全般のランキングや、量子化だけの優劣を決める実験ではない。
やったこと
比較したときの環境
今回の比較は、2026年10月3日時点の手元のPCで行った。あとで環境が変わっても、このとき何を使っていたか分かるように残しておく。
| 項目 | 構成 |
|---|---|
| CPU | Intel Core i5-13500 |
| OS・実行基盤 | Windows 11、WSL2(Ubuntu 24.04)、Docker |
| GPU | NVIDIA GeForce RTX 5090(VRAM 32GB) |
| メモリ | 64GB級。当日の記録では63.7GiB |
| 共通の入口 | Windows側のQwen Code CLI 0.21.15 |
| Q5・Q4の推論 | WSL2上のDockerで動くOllama 0.34.0 |
| Flash Nextの推論 | Windows版Strata Engine 0.1.30、MTPあり |
GPU・メモリ・実行ソフトのバージョンは当日の保存記録で確認した。CPUとOS・実行基盤の構成は既存の環境メモによるもので、今回の生成ログでは再取得していない。
比較した3構成
Qwen Code CLI 0.21.15を共通の入口にして、ブラウザーで動くスマートフォン対応のシューティングゲームを作らせた。比較したのは次の3構成だ。
| ページ上の名前 | ローカルで使用した構成 | 推論エンジン |
|---|---|---|
| Unsloth Q5 | Qwen3.8 27B / UD-Q5_K_XL | Ollama |
| Q4_K_M | Qwen3.8 27B / Q4_K_M | Ollama |
| Flash Next | Qwen3.8 Flash Next / IQ2_XS | Strata |
モデル名は今回のローカル環境での識別名。Q5とQ4は同じ27B系でも量子化が異なり、Flashはモデル構造と実行エンジンも異なる。近いサイズの候補から普段使いを選ぶのが目的だが、3構成を完全に同じ条件にそろえた比較ではない。
Ollamaの登録情報ではQ5とQ4はどちらも27.3Bだった。Q5の「UD-Q5_K_XL」は使用したモデルのタグ表記で、Ollama API上の量子化情報はunknownとなっていた。また、両方のGGUF内部の構造名はqwen35だった。ここでは保存した識別名を使い、モデル名から別の世代や性能を推定していない。
Q5・Q4とFlashを同時に推論させず、同じGPUで順番に実行した。Flashは開始時点でロード済みだったため、起動からの条件まで完全に同じではない。この違いも含めた「自分の環境での3構成」の記録として見てほしい。
初回の課題は同じ内容にそろえ、各段階1回のAPI要求で生成した。ツール実行、MCP、hooksは無効にしている。AIがファイルを自律的に編集する開発比較ではなく、CLI経由でコードを生成し、Hostが保存する比較だ。
要求した設定は、出力上限8,192 token、32K context、temperature 0.6、top_p 0.95、seed 42、thinking off。修正では3構成に同じ追加指示を渡したが、各自の前版HTMLも入力するため、文脈全体は同一ではない。Q5の修正1回目は初回の完成HTMLがなく、共通仕様からの作り直しになった。
結果:数字を見て、実際に遊ぶ
まずは「プレイ用(Codex補修)」を選んで遊んでみてほしい。同じシューティングの課題でも、画面の構成や動きに違いがある。比較するモデルと版を変えると、今のゲームは停止して入れ替わる。
記事の幅では操作しづらい場合は、試遊ページを広い画面で開く。PCはゲーム画面をクリックしてから矢印キーやWASD、タッチでは画面内の操作を使う。射撃は自動。操作方法の細部は各ゲームの説明を見てほしい。
生成にかかった時間
次の時間は、CLIを開始してから終了するまでの実測だ。モデルのロードや入出力処理を含んでいる。
| 構成 | 初回 | 共通修正1 | 共通修正2 | 3段階の合計 |
|---|---|---|---|---|
| Unsloth Q5 | 170.71秒 | 98.56秒 | 89.57秒 | 358.84秒 |
| Q4_K_M | 125.24秒 | 123.05秒 | 123.50秒 | 371.79秒 |
| Flash Next | 35.90秒 | 33.07秒 | 38.99秒 | 107.95秒 |
合計欄は、初回と2回の修正にかかった時間を足したものだ。表では小数第2位まで表示しているため、各欄の数字を足すと、合計欄と0.01秒ずれる場合がある。
これは完成までの総時間ではない。 全構成で不具合が残った3段階のCLI時間で、動作検査やCodexの補修時間を含まない。
Flashは初回開始時にロード済みで、Q4とQ5はロード時間を含んでいる。初回のロードはQ4が14.20秒、Q5が17.79秒だった。待ち時間の違いにはこの条件差も含まれる。
初回のモデル生成中のdecode速度は、Q5が61.6、Q4が70.3、Flashが166.9 token/秒だった。この値はサーバーの生成時間から計算したもので、CLI全体の速度や、ゲーム完成の速さと同じ意味ではない。出力token数も8,192・7,582・4,860と異なる。
AI原版に残った不具合
| 構成 | 初回 | 共通修正2回後のAI原版 |
|---|---|---|
| Unsloth Q5 | 8,192 tokenの上限に到達し、完成HTMLなし | 開始・敵・射撃・得点は動くが、プレイ中も開始説明カードが中央の視界を覆う |
| Q4_K_M | 開始・敵・射撃・得点は動く。一時停止クリックに不具合 | クリックによる停止・再開と、横向き画面の操作表示に不具合が残る |
| Flash Next | HTMLは完成するが、スタート後も待機状態 | 修正2回後も、スタート操作でゲームを開始できない |
Q4は修正1と修正2のHTMLがSHA-256まで完全に一致した。なぜ修正が反映されなかったかは、今回の記録だけでは分かっていない。
Q5初回は完成HTMLがなく、旧adapterでは途中のコードも保存できなかった。この版は体験の選択肢を無効にしており、後から補ったゲームを初回の成果として扱ってはいない。
うまくいった点
生成時間だけでなく、原版と補修版を残したことで、「速く返ってきたコード」と「実際に操作できる作品」を分けて見られるようになった。
保存した生成記録は3構成×3段階の9回。完成したAI HTMLは8版で、それとは別にCodexの補修版を3版保存している。体験できるHTMLは合計11版だ。
補修版では、3作品ともPCと小さな画面での開始・移動・射撃・得点・停止・再開、画面サイズ変更を確認した。PCでは自然なゲーム終了とリスタートも確認している。AI原版を完成扱いするための補修ではなく、読者が遊べる体験として、変更者を明示した別版にした。
失敗・課題:補修が入ったところ
| プレイ用の版 | Codexが補修した主な部分 |
|---|---|
| Unsloth Q5 | プレイ中の説明カード非表示、画面の余白、入力解除、複数のタッチへの対応、敵などの個数上限 |
| Q4_K_M | 描画と入力の座標変換、画面消去、停止・再開の操作、入力解除、敵弾と個数上限 |
| Flash Next | Canvasだけでのポインター捕捉、開始・停止・再開の入力、追加の指を無視する処理、操作欄の高さが変わる際の描画サイズ追従 |
補修版は各AIのコードやデザインを土台にしているが、Codexの変更が入っている。補修版で遊べることを、そのモデルが自力で完成させた証拠にはしない。 Codexの作業時間はそろった条件で測っていないため、モデルの速度比較にも加えていない。
また、今回の試行は1課題・各段階1回だけ。モデル構造、量子化、推論エンジン、FlashのMTP(複数tokenを先読みする仕組み)も異なるので、「Q5よりQ4が必ず速い」「このAIがいつでも最も優秀」といった一般化はできない。
小さな画面の検査は、PCブラウザーで360×800・390×844・844×390を再現して行った。実スマートフォンのSafariやChrome、実機での画面回転、長時間の安定性、衝突判定の細部までは未検証だ。PCでの描画間隔をスマホのFPSとしては載せていない。
普段使いに向けて
AIが2回修正した最後の版を見て、出来を重視するなら、今回はQ5を一番に評価したい。 開始・移動・射撃・得点に加えて、停止・再開まで動いていた。プレイ中に説明カードが中央に残る問題はあるが、この課題では完成に近かったと考えている。
Q4もゲームとしては動いたが、クリックでの停止・再開や横画面に不具合が残った。Flashは待ち時間が短い一方、修正2回後も開始できなかった。速くコードが返ってくることと、返ってきたものがそのまま使えることは、分けて考える必要があった。
ただし、これは一つのゲーム課題での暫定的な評価だ。AI原版は3構成とも完成とはいえず、今遊べる「プレイ用(Codex補修)」にはCodexの手直しが入っている。補修後の出来を、そのまま各モデルの実力順位にはしない。
普段使いなら短い待ち時間は魅力だが、今回のゲーム制作だけで最適なモデルを決めるには足りない。返ってきたコードを直す手間も含めて考えたい。
今回の結果からは、Q5を普段使いの有力な候補にしたい。次は候補を一つに絞り、しばらく同じモデルに固定して使ってみる。日々の依頼で、待ち時間と修正の手間が納得できるかを確かめる。現時点では、固定するモデルの決定や継続使用の結果までは出ていない。
体験では、補修版を一つ遊んだ後に「AI修正2回目」へ切り替えると、どの部分を直したのかを確かめやすい。見た目だけでなく、スタートや一時停止を実際に押してみてほしい。
環境づくりの話はRTX 5090でローカルAI環境を構築した記録、ブログ制作の話はWordPressからAstroへ置き換えた記録にまとめている。
関連記事
RTX 5090でローカルAI環境を構築した話
RTX 5090を購入して半年間放置。AIへの興味をきっかけにClaude Codeを使ってWSL2上にローカルLLM・画像生成・OCR→TTS環境を構築した試行錯誤の記録。
WordPressをやめてClaude Codeでブログをリニューアルした話
WordPressの管理画面が使いこなせなかった非エンジニアが、Claude Codeと会話するだけでAstro静的サイトへ移行した全記録。SSH接続からデプロイまで1日で完了。
1枚絵から15秒のMVへ。RTX 5090でLTX-2.5を動かしてみた
手元の1枚のイラストを、ローカルのLTX-2.5だけで縦型MVにした記録。生成時間、VRAM、うまくいかなかったカット、テロップの入れ方まで実測で残す。