画像1枚から10秒のCM動画を作った。顔が崩れず、文字も読めた全記録
note.comでも読む
「同じ人物のはずなのに、生成するたびに顔が変わる」 「商品のラベルの文字が、毎回ぐにゃぐにゃに崩れて読めない」 「ナレーションの読み方がおかしい。でも直し方が分からないから、また最初から生成するしかない」
Xでこういう声を何度も見かけました。CM風の動画に挑んだ人ならではの、あの途方に暮れる感じです。
2026年9月13日、架空の日本酒「寒桜(かんざくら)」のCM風動画を作りました。使ったのは画像1枚と、ChatGPTとGemini。10秒の縦型動画(画面の縦横比が9対16のスマホサイズ)が出てきたとき、正直「あ、動いた」と声が出ました。人物の顔もメガネも、瓶のラベルの文字も、全カットで崩れませんでした。
📺 できあがった10秒のCM
https://www.youtube.com/watch?v=48ZofMFpwaM
ただし、一発で完成したわけでは全然なくて。AIが「一献」を「いっけん」と読む事故が起きたり、2回目の生成でカットの順番がバラバラになったりしました。この記事では、その失敗と直し方まで含めて全部書きます。

「また顔が変わった」を繰り返している人へ
「同じ人物を指定しているのに、生成するたびに顔が変わる。商品の文字も崩れて別の字になる」という、CM風の動画に挑んだ人ならではの困りごとを、Xで何度も見かけました。
CM風動画をAIで作ろうとすると、この壁にぶつかりやすいです。
動画AIに「この人物を使って動画を作って」と指示するたびに、顔のパーツが微妙に変わる。髪型が変わる。メガネがあったりなかったりする。商品のラベルに書いてあるはずの文字が、まったく別の字になって出てくる。
「もっと細かく指示すれば直るかも」と思って何度も生成しても、全体が作り直されるので、直った部分と崩れた部分が毎回入れ替わる。良くなったと思ったら別のところが壊れる、のループです。
生成AIは「新しく描く」ことが得意な反面、「前と完全に同じものを再現する」ことはとても苦手です。何度やり直しても、同じ指示で同じ結果は出ません。これはツールの欠陥ではなく、いまの生成AIの基本的な性質です。
だとすると、戦略を変える必要があります。「生成で粘って直す」より、「崩れにくい仕込みをしてから生成し、ズレた部分だけ後から直す」ほうが、ずっと早く終わります。
作れた。ただ、「読めた」理由が後から分かった
「ナレーションの読み方がおかしいとき、どう直せばいいのか分からない。結局もう1回生成するしかないの?」という声もありました。生成で粘るしかないと思い込んでいる人は多いようです。
Xで、かなまるさんが架空のスパークリング酒のCM動画を作っている作例を見て、「これをやってみたい」と思ったのが最初のきっかけです。
最初は「どうせ顔が崩れるだろう」と半分諦めながら作り始めました。ところが出てきた動画は、うちのキャラクター「suzumin」の顔が、メガネも含めて全カットで保たれていました。瓶のラベルに書いた「寒桜」の文字も読める状態で出てきました。
なぜ崩れなかったのか。後から気づいたのは、「動画AIに顔を毎回描かせなかったから」です。
今回の手順は、こうです。

ステップ1|絵コンテを「1枚の画像」にまとめる
まずChatGPTに、9コマの絵コンテ(3列×3行に並んだコマ割り)を「1枚の縦長画像」として描かせました。コマごとに「何を映すか」を文章で細かく指定しています。
suzuminはメガネの女性キャラクターです。顔と衣装を固定するために、参照画像を2枚渡しました。表情のシートと衣装のシートです。AIに「この顔でこの服を着た人物で描いて」と伝えることで、絵コンテの段階でキャラクターの見た目を決めてしまいました。
ステップ2|絵コンテ画像1枚を動画AIに渡す
その絵コンテ画像1枚を、Google FlowというGoogleのツールの中でGemini(「Gemini Omni Flash 1.1」というモデル)に渡しました。「9コマを左上から順に、1カット1シーンでつなぐ。分割画面やコマ番号は映さない」と指示して、10秒の縦動画を生成しました。
顔が崩れなかった理由は、おそらくここにあります。動画AIは絵コンテ画像を基準にして動画を作るので、顔を毎回ゼロから描くよりブレが出にくい。今回はそれで、顔のブレを抑えられました。
プロンプトをこう書いた理由を、先に整理しておきます。
- 9コマを1枚の画像にした理由:コマを別々の画像として渡すと、AIが「どの順番でつなぐか」を勝手に判断してしまう。1枚の中に左上から順番に並べることで、順番を画像で伝えた
- 「分割画面を映さない」と明示した理由:指示しないと、絵コンテのコマ割り線がそのまま動画の画面内に出てくることがある
- 喉のアップや飲む効果音を入れなかった理由:酒類広告には業界の自主基準があり、飲む行為を強調する表現は避けた
絵コンテ生成プロンプト全文
架空の日本酒ブランド「寒桜(かんざくら)」のTVCM用フォトストーリーボードを1枚の画像として生成してください。
【サイズ・構成】
全体9:16の縦長画像。
3列×3行、合計9コマの均等なグリッド。各コマも縦長9:16。
細いアイボリーの区切り線でコマを分ける。
左上から右へ、上段→中段→下段の順に01〜09の小さな白いコマ番号を各コマの左上に表示する。
すべてのコマを、完成した実写CMから切り出したような高品質な写真にする。
【コンセプト】
「今日も、一献。」
一日の終わりに、居酒屋のカウンターでひとり静かに過ごす時間。
派手な演出に頼らず、注ぐ所作・肴・徳利とお猪口の質感・飲む仕草・商品カットを織り交ぜ、
熱燗と肴が美味しそうに見える構成にする。
【出演者】
全コマで同じ、添付の表情シートの女性(実写のsuzumin)。
顔立ち・赤茶色に青のインナーカラーが入ったショートボブ・細いワイヤーフレームの丸メガネを、表情シートどおりに全カットで維持する。
表情は、シートの「Neutral」「Smile」「Thoughtful」の範囲で穏やかに使い分ける(「Laugh」のような大きな表情は使わない)。
落ち着いた大人の女性として描く。25歳以上に見える顔立ちと佇まいにし、若く幼く見せない。
肌の質感は自然に残し、過度な美肌加工や人形のような顔にしない。
衣装は添付のコスチュームデザインセットの「2. クリエイターカジュアル」: ベージュのゆったりしたカーディガン、白のトップス、デニム。
秋の夜に合わせて、首元にネイビーの薄手ストールを軽く巻く。髪に小さな花モチーフのヘアピン。
仕事帰りに一人でふらっと寄った、力の抜けた装い。
顔立ち、髪型、メガネ、体格、衣装を全カットで統一する。
【商品】
架空の日本酒ブランド「寒桜」。
一升瓶(1800ml相当のガラス瓶、和酒らしいシルエット)。
ラベルは白地に、黒の筆文字で大きく縦書きの「寒桜」。右脇に小さく「特別純米」「辛口」の文字を縦書きで添え、左脇に細い英字で「KANZAKURA」と縦に入れる。
筆文字は太く、はっきりと読める字形にする(「寒」の字が他の字に見えないように)。
ラベル下部に小さく赤い丸印(酒蔵の印章のような、具体的などの銘柄にも属さない架空の意匠)。
瓶の表面には熱燗にした際のわずかな湯気と、常温部分にはうっすらとした結露を描き分ける。
徳利は黒い陶器、お猪口も黒い陶器で統一する。
肴はサンマの塩焼き、白い長皿にのせ、大根おろしとすだちを添える。
【ロケーション】
昔ながらの居酒屋のカウンター席。
木目の残るカウンター、奥に暖簾越しの厨房、洗い場に積まれた皿、吊るされた提灯や品書きの短冊。
生活感のある、落ち着いた賑わいの空間。
暖色の白熱灯・提灯の灯り、炭火焼き台の赤い光が奥にほのかに見える。
【9コマの内容:上段左から右へ、中段左から右へ、下段左から右へ】
01:
カウンターに一人で座る女性の、腰から上の引きの写真。
奥に厨房、積まれた皿、暖簾が見える。カーディガンの肩の力が抜けた、一日の終わりの自然な姿勢。
02:
カウンター越しの女性のミディアムショット。
手前に寒桜の徳利とお猪口、サンマの塩焼きの皿がのぞく。
女性は穏やかな表情でカウンターの向こうを見ている。
03:
黒い徳利からお猪口へ酒を注ぐ手元の極端な接写。
とろりとした酒の質感、立ちのぼる湯気、指先の陰影を精密に描く。
背景は浅い被写界深度でぼかす。
04:
サンマの塩焼きを箸でほぐす手元の接写。
皮の焼き目の照り、立ちのぼる煙、大根おろしとすだちの彩りを鮮明に描く。
05:
寒桜の一升瓶を主役にした静物マクロ写真。
木のカウンターに瓶を立てて置き、ラベルの筆文字にピントを合わせる。
瓶肌のわずかな結露、背景の暖色の灯りを浅い被写界深度でぼかす。
06:
女性がお猪口を口元に運び、ひと口含む横顔の接写。
喉元や飲み下す瞬間は映さず、口元と頬のラインまでにとどめる。
穏やかで満足そうな表情、灯りが横顔に柔らかく当たる。
07:
カウンターを真上から撮影したフラットレイ。
中央に寒桜の徳利、右にお猪口、左にサンマの塩焼きの皿、手前に大根おろしとすだちの小皿。
木目の質感と灯りの反射を生かし、余白を残す。
08:
女性の顔を大きく捉えた親密なポートレート。
画面片側の頬のそばに寒桜の一升瓶を縦に持ち、ラベルをカメラへ向ける。
メガネ越しに少し目を細めた柔らかな微笑み、大人らしい落ち着きを表情に出す。
指は5本の構造がはっきり分かるように描く。指を6本以上にしない。手の甲や指で、口・メガネ・目を隠さない。
09:
締めの商品広告カット。
カウンターの上に寒桜の一升瓶、徳利、お猪口、サンマの塩焼きの皿を配置。
背景は暖色の灯りと厨房の気配が柔らかくぼけている。
画面上側に文字用の余白を確保する。
上段に「今日も、一献。」
その下に大きく「寒桜」
さらにその下に小さく「制作: suzuMin」
コピーと「制作: suzuMin」は落ち着いたベージュがかった細い明朝体、ブランド名は黒の筆文字体。
【撮影・光・色】
高品質な実写の飲食広告。
人物は自然な遠近感の標準〜中望遠レンズ、商品と肴はマクロレンズの描写。
暖色の白熱灯・提灯の灯りを基調に、炭火のわずかな赤みを差し色にする。
色はブランドカラー(緑・橙)に寄せず、木の茶色、黒、生成り、炭火の赤みなど「飲食が美味しそうに見える」暖色を優先する。
ハイライトは滑らかで、影には奥行きを残す。微細なフィルムグレイン。
過剰な光彩、極端なオレンジ色の加工、コントラストの効かせすぎはしない。
全コマで灯りの方向、商品のラベルデザイン、人物の特徴を一貫させる。
人物の引き、顔の寄り、手元、酒、肴、俯瞰、商品広告を組み合わせ、画角にリズムを作る。
指定以外のキャッチコピー、透かし、余分なロゴ、実在する酒蔵・銘柄のロゴやラベルデザインは入れない。
喉を強調するアングル、飲み干す瞬間の誇張した表現は避ける。
動画側のプロンプトで、こだわった点は3つです。
- 「各カットは動作をひとつに絞る」と書いた理由:10秒で9カットなので、1カット約1秒。動きを詰め込むと何をしているか分からなくなる
- 「モーフィングを使わない」と書いた理由:モーフィングは、前の場面の形が溶けるように次の場面へつながる変化のこと。指示しないと、人物が瓶に変形するような不気味なつなぎが出ることがある
- 音と文字を細かく指定した理由:音は指示しないと勝手に付く。文字は動画側に生成させると崩れるので、「絵コンテに写っている文字をそのまま残す」だけにした
動画生成プロンプト全文
添付した9コマの絵コンテ画像を参照して、10秒の実写風CM動画にしてください。
架空の日本酒ブランド「寒桜」の、居酒屋のカウンターでひとり過ごす夜のTVCM。
落ち着いた大人の時間、静かな満足感、押しつけがましくない幸福感を映像にしてください。
【最重要:完全維持】
絵コンテの人物(顔立ち・赤茶色に青のインナーカラーのショートボブ・丸メガネ・体格・衣装)を全カットで忠実に再現し、変えないでください。メガネは全カットで外さないでください。
一升瓶のラベルデザイン・「寒桜」の筆文字・「KANZAKURA」の英字・「特別純米」「辛口」の表記は、絵コンテと同じ見た目を保ってください。
徳利・お猪口・サンマの塩焼きの皿など、小物の形と色も維持してください。
【画面構成・カット割り】
絵コンテの9コマを、左上から右へ、上段→中段→下段の順に、時系列の9シーンとして映像化してください。
各シーンは画面いっぱいに表示する1カット1シーンの全画面映像にしてください。
分割画面、グリッド、コラージュ、区切り線、コマ番号は、動画のどの時点でも一切表示しないでください。
特に冒頭0.5秒についても、9コマ全体やグリッドをそのまま映さず、必ず1カット目の映像から始めてください。
シーンとシーンは自然なカット編集でつないでください。人物や物体の形が滑らかに変形するモーフィングは使わないでください。
各カットは動作をひとつに絞り、短い時間の中に複数の動きを詰め込まないでください。
【酒類広告として守ること】
お猪口を口に運ぶカットでは、口元・頬のラインまでにとどめ、喉のアップや飲み下す瞬間を大写しにしないでください。
飲む音は強調しないでください。ゴクゴクという嚥下音・飲み干す効果音は入れないでください。
「元気になる」「効く」など、飲用による効能や気分の変化を断定するような演出・ナレーションは入れないでください。
登場人物は落ち着いた大人の女性として描き、若く見せる演出(幼い表情・はしゃぐ動作など)は避けてください。
【音の演出】
落ち着いたアコースティックギターと木琴による、静かで温かみのあるオリジナルBGMを使ってください。
居酒屋の喧騒(食器の音、遠くの話し声)はごく薄く添える程度にとどめてください。
徳利からお猪口へ注ぐシーンでは、とろりとした液体の音を心地よく際立たせてください。
締めに、落ち着いた成人女性の短い声で「きょうも、いっこん。」とだけ言ってください。
漢字で書くと「今日も、一献。」ですが、読みは必ず「いっこん」です。「いっけん」「いちけん」とは読まないでください。
【文字】
文字・字幕・テロップは動画側で新たに生成しないでください。
締めのカット(絵コンテ09)に写っている3つの文字、上から「今日も、一献。」・大きな筆文字の「寒桜」・小さな「制作: suzuMin」は、
3つとも絵コンテに写っている状態のままカットに残してください。特に大きな筆文字の「寒桜」を省略しないでください。
09の背景は絵コンテどおり、暖色の灯りと店内がやわらかくぼけた居酒屋のカウンターにしてください。無地の壁にしないでください。
瓶に絵コンテに無いラベルや札を追加しないでください。動画側で新しい文言や別のロゴを追加しないでください。
【その他】
縦型(9:16)、約10秒で生成してください。
実写映像として生成し、イラスト調・アニメ調にはしないでください。
カメラは各カット内では大きく動かさず、穏やかな手持ち風の揺れ程度にとどめてください。ズームや旋回などの大きなカメラワークは避けてください。
指定以外のテキスト、ウォーターマーク風の飾り、実在する酒蔵・銘柄を想起させる意匠は追加しないでください。

AIが「一献」を「いっけん」と読んだ話
「文字や顔の崩れは、生成で粘るより後から直すほうが早い。でもその選択肢を初心者は知らない」という経験者の意見もあり、今回の私の判断とそのまま重なりました。
出てきた動画の映像は、ほぼ想定通りでした。9カットが順番通りに並び、冒頭に絵コンテがそのまま映る事故もなし。
ただ、1か所だけ盛大にズレた部分がありました。
締めの一言「今日も、一献。」を、AIの声が「いっけん」と読みました。正しくは「いっこん」です。
プロンプトをひらがな「きょうも、いっこん。」に書き直して2回目を生成しても、また「いっけん」。原因は確認できていません。ただ、Google Flowの公式ヘルプには「日本語に対応しているが、最良の結果には英語の指示を推奨」とあるので、日本語の細かい読みの指定が反映されにくいのかもしれません。
さらに、2回目は別の問題が出ました。
締めの画面は直ったのですが、今度は9カットの順番が入れ替わりました。真上から撮るはずのカットが消え、液体を注ぐカットが2回出てきました。同じ指示を出しても、毎回まったく同じ動画にはならないのが生成AIの性質です。
3回目を生成するか、一瞬迷いました。でも、1回目の1〜8カット目は良い状態で出ています。3回目を作っても、また全部が変わる。良かった部分まで失うリスクがあります。
生成で粘らず、つないで直す
3回目は作りませんでした。代わりに、編集で組みました。
映像の直し方
1回目の動画から1〜8カット目を使い、2回目の動画から9カット目(締めの画面)を取り出して、最後につなぎました。カットとカットの切り替わりはもともと瞬間的な切り替えなので、つなぎ目は目立ちません。
音の直し方
ここが少し手間がかかりました。元の動画は、BGMとナレーションが混ざった1本の音声として書き出されています。今回の編集だけでは声だけをきれいに消せなかったので、声が入っている区間(7.75秒から末尾)を、同じ動画の別の区間のBGMで差し替えました。その上に、Geminiの読み上げ機能(Zephyrという声)で録った「きょうも、いっこん。」を重ねました。
声の調整にも少し時間がかかりました。最初に「ささやくように」と指示したら、暗くて怖い雰囲気になり、笑顔の映像と合いませんでした。次に「弾むように明るく」にしたら、今度は声が高すぎました。「穏やかで温かい・口角が上がっている・普通の声量」という指示でちょうどよくなりました。同じ指示で3本作って聞き比べて、一番しっくりくるものを選びました。
読み方のアクセントも文章で指定しています。「いっこん」は頭の「い」が高く、あとは下がる読み方。これも「頭のいが高く、あとは下がるアクセントで」と書きました。

今回の体験から持ち帰った3つのこと
その1|顔・服・ラベルの文字は「絵コンテの段階で固定する」
動画AIに毎回描かせるのではなく、1枚の絵コンテ画像の中で決めてしまう。動画AIは「その画像を動かす」作業をするので、ブレが格段に減ります。
その2|AIの読み間違いは、生成で粘らず「後から差し替える」
生成をやり直すたびに、動画全体が変わります。直したい部分だけでなく、うまくいっていた部分まで失う可能性があります。声だけ差し替えるほうが、結果として早く終わります。
その3|同じ指示でも毎回違うものが出る。比べて選ぶ前提で動く
1回で決めようとせず、2〜3本並べて聞き比べ・見比べる。これが今のAI動画生成の現実的な使い方だと感じています。なお、Google Flowは「クレジット」という生成に使うポイントの制度で、今回は1本の生成で15クレジットを消費しました。やり直しのたびに減るので、比べて選ぶにも上限があります。
まとめ:「生成で粘る」より「仕込みと編集で補う」
もし試すなら、最初の一歩はこれだけです。ChatGPTに「3列×3行の絵コンテを1枚の画像で」と頼み、その1枚を動画AIに渡す。崩れた部分があっても生成し直さず、「あとで差し替える」前提で見る。この記事のプロンプト2本は、そのままコピーして書き換えて使えます。
CM風動画でAIに挑む人が詰まりやすいのは、「全部AIに任せて一発で完成させようとする」ところだと思います。今の生成AIにその期待は少し重すぎます。
顔と服は絵コンテで固定する。声がおかしければ差し替える。カット順が崩れたら使えるカットだけ取り出してつなぐ。AIは「よく働くが、たまに読み間違いをする新人」くらいの感覚で、人間が最後の判断を持つ。そのほうが、むしろ早く・ちゃんとしたものが出来上がります。
今回の記録が、CM動画に挑もうとしている誰かの「あ、それやればよかったのか」になれば嬉しいです。
次に動画を作るときに見返せるよう、スキを押しておいてください。
この記事への感想・「自分はここで詰まった」という話は、コメントで教えてもらえると助かります。同じ場所で止まっている人のヒントになるかもしれないので、失敗談も大歓迎です。
しんえもんのnoteをフォローすると、こういう実録記事が届きます。「うまくいった話」より「失敗して、こう直した」を書くアカウントです。