Gemini TTSでMioの声を選ぶ 話し声から歌声にするまで
Google AI StudioでLedaの声を選び、台本と話し方を指定してWAVを保存。その話し声をSoulXで歌声の参照に使った流れを、『吾輩は猫である』の朗読例と直接歌唱の試作、採用歌声で聞いてみる。
ATELIER NOTES
AI、デジタル創作、工作。試した過程と、うまくいかなかったこと。
35件の記事
Google AI StudioでLedaの声を選び、台本と話し方を指定してWAVを保存。その話し声をSoulXで歌声の参照に使った流れを、『吾輩は猫である』の朗読例と直接歌唱の試作、採用歌声で聞いてみる。
ダンスと音楽の位置合わせに苦戦しながら、Mioの歌声を選んだ。Qwen TTSの初期版と、Google TTSのLedaの話し声をSoulXで歌声に変えた採用版を、約15.83秒の動画2本で聞き比べる。
踊る動画は作れても、Mioに指定した振付を踊らせるのは難しかった。参照画像の失敗やAIとのやり取りを経て、MiniMax H3で短い区間をつないだ制作記録。
自分のRTX 5090で普段使いするローカルAIを選ぶため、Qwenの3構成で同じゲーム制作課題を試した。生成時間と出来上がりを比べ、記事内で原版とCodex補修版を体験できる。
同じMioの元画像を参照して、後ろ向きから振り返る全身ポーズを3方式で生成。ポーズの指示に従うか、顔・衣装・耳・尾を保てるかを分けて見比べる。
公開済みのLTX-2.5記事と同じ約5秒の設定で、Mio原案の正面図を動かした。同じ正面図のMiniMax H3動画も追加し、元絵・衣装・構図の違いを実動画で確認する。
手元の1枚のイラストを、ローカルのLTX-2.5だけで縦型MVにした記録。生成時間、VRAM、うまくいかなかったカット、テロップの入れ方まで実測で残す。
最終回。Obsidian環境を作り、入力の入り口を整えて、ローカルGPUで一次整理する。入れたものが整理され、過去の取り組みも会話中に引き出せるところまで来た——入力から再参照までの設計と動線が一周したところと、まだ残っている確認作業の、正直な記録。
第7弾。前回「使い切れていない」と書いたRTX 5090に、過去のAI会話800件超を一晩で全部読ませて、自分の思考の索引を作らせた。課金ゼロ・外部送信ゼロ。そして画像・3Dモデル・電子工作まで任せる体制づくりを始めた、その途中経過。
音声入力のためにカメラ用マイクを設置したが、固定するスタンドがなかった。デスクシェルフの板に差し込む形の台を3Dプリントで作った。シューマウントの寸法で2回失敗した記録と、STLデータの配布。
第6弾。画像生成やOCR・読み上げに使っているRTX 5090、それでも性能を使い切れていない感覚があった。ローカルLLMは能力が心配で使いどころが難しい。悩んだ末に「音声メモの仕分け係」という地味な仕事を任せてみた、その正直な途中経過。
第5弾。AIとの会話779件をObsidianに集めたあと、タグも表記もバラバラなままでは使えなかった。タグ正規化、Decision Record、vault-checkで、AIに任せる前にまず整える話。
以前から試していた音声入力を、通勤中やPC前で前より使うようになった。キーボードで消えがちな考えを、声で外に出して残す話。
第4弾。ChatGPT・Claude・Copilot・Gemini……AIツールをまたいで会話が散らばり、「あの話どこでしたっけ」になっていた。数年分の会話779件をObsidianの一か所に集めて、探せるようにした話。やってみて「エクスポートは万能じゃない」と分かった、つまずきの記録。
子どもの読み聞かせで寝落ちする父親が、手持ちの本をOCR→TTSで音声化するパイプラインを自作した記録。更新が止まっていたブログを再開できた理由から、OCRの文字化け、LLMの暴走、完全自動化を諦めるまでをまとめた総集編。
第3弾。Obsidianに三層構造を作り、CLAUDE.mdを設計した。でも正直、まだ自分の手に馴染んでいない。借り物の構造を自分の工具箱に組み直すまでの、つまずきの記録。
第2弾。第1弾で「過去の自分を救い出す」と決めた。でも世界はもう先に進んでいるかもしれない。日本語圏と英語圏を調べて、自分が陣取れる場所を5軸で確認した話。
AIを使うほど考えることが増えて、同じことをまた一から考え直していた。「考えが消えていく」「会話が埋もれる」を解決するため、Obsidian × Claude Code で自分の脳を組み直すシリーズの第1弾。
PDFから音声まで16ステップのパイプラインを作った。完全自動を目指したが、辞書登録と品質確認は人間がやるほうがいい——と気づくまでの話。
TTS音質の壁にぶつかり、ComfyUIで音声クローンとVoiceDesignを試し、Whisperで品質を自動検証する仕組みを作った話。
VOICEVOX・Style-Bert-VITS2・Qwen3-TTSの3エンジンに同じ「吾輩は猫である」を読ませた。読みの正確さと自然なイントネーションは両立しない——と気づくまでの話。
OCR校正用のローカルLLMを選ぶのに、OOM・タイムアウト・thinking暴走を経験した。最終的にQwen3 32Bのthinking抑制で14.6倍の速度改善を得た話。
tmuxとは何か、なぜ必要かを理解するところから、Claude Codeのサブエージェント・エージェントチームの違い、セキュリティ設定、使い方までをまとめた非エンジニア向けガイド。
OCRで取り出したテキストをLLMに校正させたら、文章が要約されたり消えたりした。前処理の順番を間違えると、AIは暴走する。
ChatGPT、Claude、Gemini、Grok、Copilot……半年以上AIツールを乗り換え続けた非エンジニアが、最終的にClaude Code+Copilotの二刀流に落ち着いた記録。
Claude CodeをWindows+WSL2で使う中で起きたOneDrive問題、パス混乱、設定ファイルの散乱。3階層の設定構造を理解して整理した記録。
ChatGPTの画像生成機能を使って、子どもの写真からLINEスタンプを作成・販売した記録。親子でAIと遊びながら、使い方や注意点を学ぶきっかけになった。
2005年、父親からもらったPentium 4が全ての始まりだった。動画編集、Minecraft、そしてローカルAI。20年間で4回の進化を遂げた自作PCの記録。
PDF小説の音声化を目指してTesseractでOCRしたら文字化けだらけ。日本語特化のYomiTokuに切り替えるまでの試行錯誤の記録。
RTX 5090を購入して半年間放置。AIへの興味をきっかけにClaude Codeを使ってWSL2上にローカルLLM・画像生成・OCR→TTS環境を構築した試行錯誤の記録。
WordPressの管理画面が使いこなせなかった非エンジニアが、Claude Codeと会話するだけでAstro静的サイトへ移行した全記録。SSH接続からデプロイまで1日で完了。
読み聞かせで先に寝落ちする父親が、OCR+TTSで"自分のために本を読んでくれる仕組み"を作れないかAIに相談してみた。開発への第一歩の記録。
車載用スピーカー(carrozzeria TS-F1010)と3Dプリンター(Bambu Lab A1)でPCデスク用バスレフスピーカーを自作。設計の試行錯誤から完成までの記録。
子どものBlender体験をきっかけにBambu Lab A1を購入。コスト比較・設置・ニオイ・印刷時間など、家族がいるリビングで使うリアルな情報をまとめました。
工場勤務の元自動車整備士が、ChatGPTとの出会いをきっかけにブログを始めた理由。非エンジニアがAI時代に「作る側」を目指す記録のはじまり。
該当する記事が見つかりません。言葉を短くするか、検索をクリアしてみてください。