記事一覧
AI活用の記録 AIとできたことやってみたAI動画生成MiniMaxGeminiAI活用動画制作

AI動画で日本語の文字が4回崩れた。別のAIに替えたら1発で通った【全記録】

note.comでも読む

AI動画の日本語文字が崩れた状態と、別のAIに替えて崩れなくなった状態を左右で見比べる手描き風イラスト。左のスマホでは白い立体文字が割れて崩れ、右のスマホでは文字がきれいに立ち、上部に「4回崩れた → 1発で通った」の見出し

「プロンプトの書き方が悪いのかな」と思って、何度も書き直しました。日本語で書いてみた。英語に変えてみた。絵コンテにして焼き込んでみた。それでも、同じ文字が同じように崩れ続けた4回。

崩れ方もバラバラで、「②開発」が「②開発発」になる回もあれば、「⑥AI活用」が「AI utilion」というわけのわからないアルファベットに化ける回もある。毎回違う崩れ方をするから、「何が原因か」すら特定できない。

そのまま粘り続けるか、ツールを替えるか。迷って、5回目の直前で手を止めました。


Geminiで生成した4本の動画から、⑥の駅が映るコマを1枚ずつ並べた画像。「AI活用」が左から「AI jutillon」「AI utilion」「AI atilzon」「AI sutilon」と4本とも別の文字に化けている

「指示の書き方を変えれば直る」と思っていた。4回試して、仮説が全部外れた

「画像生成では文字がちゃんと出るのに、同じ文字を動画にした途端に崩れる。どこが違うのか分からないまま、やり直しだけが増える」という声を、Xで何度も見かけました。

前回の記事(2026年9月13日公開)で、Gemini(Google FlowというGoogleのツールの中で「Omni 1.1 Flash」というモデルを選んで使いました)を使って日本酒の10秒CMを作りました。あのときは、ラベルの文字も人物の顔も保たれた。だから今回も同じツールから始めたのは自然な流れでした。

今回作りたかったのは、自社(suzuMin)の自己紹介CM。縦型・10秒・音つき。オレンジ一色の空間に白い路線図の線が走り、「①Webデザイン ②開発 ③広告 ④SNS ⑤動画 ⑥AI活用」の6駅が並ぶ。上には屋号「suzuMin」と「AIで作る、私の形。」という一言。自社キャラクターのsuzuminがその文字の中を歩く、というイメージです。

ChatGPTで生成した縦長の路線図ポスター。オレンジの背景に白い路線の線が走り、①Webデザインから⑥AI活用までの6駅と屋号suzuMin、一言「AIで作る、私の形。」が配置され、白とネイビーのジャケットを着たsuzuminが歩いている

きっかけはXで見た、た〜やさんの作例でした。路線図のポスター1枚から、立体の文字の中を人が歩く10秒CMが生まれていた。「これだ」と思って、公開されていた作例を参考に、同じ構成を試そうとしました。

Geminiに同じポスターを渡して、4回試しました。何を変えて、どう崩れたか、順番に書きます。

1回目|ポスターが1秒で消えた

ポスターを「動画の最初の1コマ(=動画を開いた瞬間に見える画面)」として渡したら、1秒で溶けて消えました。⑥「AI活用」がローマ字のような別の文字に化け、画面を覆う場面転換で実在しない漢字の塊が出現。

2回目|参照画像に変えたら6駅は出た。でも3つ化けた

渡し方を変えて「参照する画像」として送り直したら、最初からセットの中で動き始め、6駅は順番どおり出ました。ただし10秒ずっと真横を歩くだけ。文字は①「Web デザイgn」②「開発発」⑥「AI utilion」と3つが崩れた。無事だった③広告・④SNS・⑤動画を見ると、「日本語だけ」か「英字だけ」の駅でした。崩れた3つはすべて「日本語+英字の2段」の駅。そこに何かある、と思いました。

3回目|指示を日本語で書き直した。崩れ方は変わらなかった

「英語で指示を書くと、日本語の扱いが弱くなるのでは」という仮説を確かめるために、すべての指示を日本語で書き直しました。駅ごとの動作(かがんでくぐる・文字に触れる)は効いた。でも文字の崩れ方は同じでした。言語を変えても、今回の用途では差が出なかった。

4回目|前回効いた「絵コンテ方式」を試した。それでも同じ文字が崩れた

前回の日本酒CMで成功した方法を使いました。9コマの絵コンテを1枚の画像に焼き込み、動画AIには「絵コンテのとおりに保つだけ」を指示する方法です。出発・振り返り・締めの3コマは絵コンテどおりに出た。でも駅の6コマは文字が小さく平らに描き直され、⑥「AI活用」は「AI sutilon」に。4回連続で同じ文字が崩れました。

ここで気づいたことがあります。前回の日本酒CMで文字が保たれたのは、人物のいない静止した締めの画面だけでした。今回の4回では、人物と文字が同じ画面にある場面で、文字が毎回描き直されていました。絵コンテに焼いても、それは変わりませんでした。

Geminiの公式ドキュメントには「英語は完全対応。その他の言語は評価しておらず、動くこともあるが結果は変わりうる」と書かれています。今回の「人物と同じ画面に大きな日本語を描く」という用途は、その「評価していない領域」だったのだと思います。Geminiが「ダメ」なのではなく、この使い方が苦手な領域だった、ということです。


📺 できあがった10秒のCM

https://youtube.com/shorts/mDZoRdFW5nA

4回目まで粘って、5回目の直前で手を止めた。その先の記録です。


MiniMaxで生成した1本目の動画の1コマ。オレンジの空間に立体の白い文字「AI活用」と緑の丸番号6が立ち、その横にsuzuminが立っている。文字は崩れていない

ツールを替えたら、1本目で通った

一方で「全部ダメではなく、ツールごとに差が大きい。1つのツールで粘るより、見切りの早さが要るのでは」という見方もありました。

た〜やさんの作例がMiniMaxというAIで作られていたことを思い出して、同じツールを使うことにしました。fal.aiというサービス(複数の動画AIを1か所から使えるサービス)でMiniMax H3 Max(別名:Hailuo)を選び、ポスターを「動画の最初の1コマ」として渡しました。

指示文は、た〜やさんが公開していた英語のテキストを一字も変えずにそのまま貼りました。なぜ変えなかったか。うまくいかなかったときに「何が原因か」を判断できるようにするため、最初は余計な変数を増やさない方がいいと思ったからです。

費用は1本約0.80ドル(記事執筆時点。9月30日までの半額キャンペーン価格で、通常は約1.60ドルです)。Geminiは1本15クレジット消費のクレジット制でした。

1本目の結果

オレンジの世界が10秒保たれ、文字は厚みのある立体として空間に立ち、suzuminが指で触れる・見上げる・脇を通る。⑥「AI活用」が無傷。6駅すべて出ました。締めは緑の「6」の駅マークが手前を横切って画面を覆い、ロゴ画面へ。

ただし完璧ではなく、SNSの下の小さな英字が「ANS」になっていたり、③広告が画面の端で切れる場面があったり、③と④の出る順が一部入れ替わっていたりしました。大きな日本語は無傷でも、小さな英字は所々崩れた。「MiniMaxなら文字が崩れない」とは書けません。今回の3本では大きな日本語が3本とも無傷だった、というのが正確なところです。

2本目・3本目(乱数だけ変えて追加生成)

同じ指示で乱数(=同じ指示から毎回違う結果を出すための番号)だけを変えて2本追加しました。2本目はテンポが良く、飛行機・車・電車の模型が路線を走り、広告の文字の下をかがんでくぐる場面があって動きは一番好みでした。でも⑥AI活用が駅として出ない。3本目はカメラが動かず、人物が前を歩くだけ。3本で約2.40ドルです。

内容は1本目、動きは2本目。悩んで、総合で1本目を採用しました。

完成した動画を0.5秒ごとに並べたコマ一覧。①Webデザインから⑥AI活用まで順番に現れ、最後に緑の駅マークが画面を覆ってsuzuMinのロゴ画面で終わる


ポスターとMiniMaxの指示文、全文を公開します

「生成ガチャ」という言葉で語る人もいます。同じ指示でも毎回結果が違うので、1回で決めずに何本か出して選ぶ前提で動いている、という体験談です。

ポスターのプロンプトを書くときに考えたこと

ポスターの指示文は、Xでミヤマさんが公開していた「路線図×空港サイン×ポスター」の指示文を骨格にして、自分の用途に書き換えたものです。

  • 文字は「6駅+屋号+一言」に絞り、「これ以外の見出しを追加しない」と書いた。それでも指定していない小さな文字が床や端に増えたので、生成後に画像編集で消した。「見出し」の禁止では、小さな文字までは止まらなかった
  • 人物は正面の棒立ちにせず「歩いている一瞬」を切り出すよう書いた。動画にしたときに歩き出しやすいポスターにするため
  • 人物と文字とルートラインを「前後に交差させる」と書いた。人物を背景の上に置いただけの写真だと、動画で文字が「背景の飾り」になってしまうため

ポスター生成プロンプト全文(参照画像2枚を添付して使う)

添付した2枚の参照画像(① suzuminの表情シート ② コスチュームデザインセット)をもとに、
「日本の文化施設の企画展ポスター × 空港サイン計画 × 路線図 × モダニズム・タイポグラフィ」の視覚言語で、
suzuMin(Webデザイン・開発・広告・SNS運用・動画制作を手がける屋号)の自己紹介ポスターを1枚生成してください。

【最重要・上書き指示】
主役はスクリーンショットから作った架空のファッション人格ではありません。添付①の表情シートに写っている実在の人物(suzumin本人)をそのまま描いてください。
顔立ち・赤茶色に青のインナーカラーが入ったショートボブ・細いワイヤーフレームの丸メガネを、表情シートのとおりに描いてください。
「本人写真をファッション人格へ翻訳する」「実在本人だと誤認させる再現を避ける」という一般的な指示は、この生成では適用しません。suzumin本人として認識できる見た目を維持してください。
表情は、シートの「Neutral」「Smile」「Thoughtful」の範囲で穏やかに使い分けてください(大きすぎる表情は使わない)。
落ち着いた大人の女性として描いてください。肌の質感は自然に残し、過度な美肌加工や人形のような顔にしないでください。

【サイズ】
Aspect ratio 9:16。縦長の1枚のポスターにしてください(3:4ではなく9:16)。

【出演者・衣装】
添付②のコスチュームデザインセットから「3. スポーティーコード」を着せてください。
「3. スポーティーコード」のシルエットとアイテム構成(トップス・パンツ・スニーカー・小物)はセットのとおりにし、**色はポスターの配色に合わせてアレンジしてください**: 白を基調に、ネイビーまたは深い緑を1か所(パンツやジャケットなど)、オレンジ背景に対して埋もれず、かつ喧嘩しない組み合わせにしてください。小さな花モチーフをどこかに入れてください。
小物(バッグ・ヘアピン・スニーカーのラインなど)に緑を一点だけ差し色として使ってよい。
人物は証明写真のように正面へ直立させないでください。画面を斜めに歩いている、大きく一歩踏み出している、振り返っている、片足が画面外に出ている、など自然な歩行の一瞬を切り出したポーズにしてください。
指は5本の構造がはっきり分かるように描いてください。指を6本以上にしない。手の甲や指で、口・メガネ・目を隠さないでください。

【コンセプト】
suzuMinは「AIを使って、思い通りの形をつくっていく」人です。事業領域を路線図の駅のように渡り歩いている、というテーマをビジュアル化します。
中心に置くのは、この人物の思想や活動を体現した1人の人物と、その人物が渡り歩く架空の交通網(路線図)です。人物を単なるモデルではなく、suzuMinという屋号の活動そのものとして描いてください。

【文字要素(最重要)】
以下の6語を巨大文字として画面の骨格に使ってください。日本語を主役にし、各語の近くに小さめの英字を添えてください。
文字はこの6語に厳密に絞り、これ以外の見出しを追加しないでください。

1. Webデザイン / WEB DESIGN
2. 開発 / DEV
3. 広告 / ADS
4. SNS / SNS
5. 動画 / VIDEO
6. AI活用 / AI FOR LIFE

これらを、路線図の駅名のように、①→②→③→④→⑤→⑥の順で1本のルートラインでつないでください。
⑥「AI活用/AI FOR LIFE」を人物の到達点(ゴール駅)とし、画面の中でひときわ目立つ位置に置いてください。

屋号「suzuMin」の文字を、6駅とは別に、路線図全体の起点または看板のように大きく配置してください(英字ロゴタイプのように)。

さらに、以下のテーマの一言を小さめの見出しとして1か所に配置してください:
「AIで作る、私の形。」

小さな情報文字(活動内容の一言説明など)を使う場合も、上記6語・屋号・テーマの一言の範囲にとどめ、存在しない実績や数字は創作しないでください。

【配色】
背景は、オレンジ(#F97316系)のクリア・高彩度・フラットな強い色面にしてください(印刷インクのように強い色面)。画面の大部分をこのオレンジが占めます。
ルートライン(路線図の線)と巨大文字は白を基本にしてください。
緑(#15803D系)は差し色として、駅マーク・屋号「suzuMin」の一部・矢印・小物など、面積の小さい要素に限って使ってください(画面全体の5%程度まで)。緑の大きな面は作らないでください。
人物の赤茶色の髪がオレンジ背景に埋もれないよう、人物の周囲にはルートラインや白い文字を配して輪郭が立つようにしてください。
ピンク・マゼンタは使わないでください。くすんだ色・パステル・ベージュ寄りの背景へは逃げないでください。
基本構成は、オレンジ約70〜80%・白約15〜25%・緑0〜5%を目安にしてください。

【ルートライン】
太い白色のライン(地下鉄路線図・空港誘導サインを連想させる構造)を画面全体に走らせ、6つの駅(見出し)と人物と屋号ロゴを1つの巨大なネットワークとして接続してください。
水平・垂直・直角・緩やかな角丸・分岐・画面外への連続を組み合わせてください。単なる囲み罫線にはしないでください。

【人物とグラフィックの統合】
人物を背景の上に置いた写真にしないでください。ここは非常に重要です。
人物・巨大文字・ルートラインを同じ平面上で積極的に交差させてください。
・文字の一部が人物の背後へ隠れる
・別の文字が人物の前を横切る
・ルートラインが人物の背後から前景へ抜ける
・人物の脚が巨大文字の上を横切る
などを組み合わせ、人物×タイポグラフィ×サインシステムを一体化してください。

【タイポグラフィ】
日本語は太く、骨格が明快で、建築的なゴシック体。英字はcondensed grotesk・bold sans serif・wayfinding signage typographyを基調にしてください。
文字サイズのジャンプ率を大きくし、巨大文字(6駅の日本語+屋号)約50%・中サイズ文字(英字併記)約25%・小さな情報文字約25%の構成比にしてください。すべて同じ大きさにしないでください。

【写真表現】
人物は高品質な実写ファッションフォトとして表現してください。安いAI人物写真に見せないでください。
求める品質は、high-end Japanese fashion editorial photography、premium commercial photography、natural skin texture、clean studio lighting、crisp fabric detail、realistic anatomy、anatomically correct hand, exactly five fingersです。

【質感】
全体はデジタルUIではなく、実際に印刷された文化・ファッションポスターの質感にします。clean・flat・crisp・high contrast・editorial・slightly tactile print textureを基本にしてください。過剰なノイズ、古紙、ヴィンテージ加工は禁止です。

【避けるもの】
禁止:
・SNS画面の再現、プロフィールカード風、名刺風
・人物の証明写真風の正面直立、中央棒立ち
・ピンク・マゼンタ系の背景色
・すべて同じ文字サイズ
・カラフルすぎる配色、安易なグラデーション
・実在する企業・サービスのロゴ、SNSのUI要素
・指定した6語以外の見出しテキストの追加、存在しない実績・数字の創作
・指の破綻、6本以上の指、口やメガネを隠す手

【最終チェック(生成前に内部で確認)】
1. 主役はスクリーンショットからの架空人格ではなく、添付①のsuzumin本人の顔・メガネ・髪型になっているか
2. 巨大文字は指定の6語(Webデザイン/開発/広告/SNS/動画/AI活用)+屋号「suzuMin」+テーマの一言のみで、それ以外の見出しを増やしていないか
3. 背景は緑とオレンジの2色構成で、ピンクを使っていないか
4. 太い路線ラインが6駅・人物・屋号ロゴを1つのネットワークとして接続しているか
5. 人物・文字・ラインが前後に交差し、人物が背景の上に置かれただけの構成になっていないか
6. 指の本数・メガネのフレームに破綻がないか
7. アスペクト比が9:16になっているか

Aspect ratio: 9:16
Language: Japanese with English subtext
High-resolution editorial poster

元にした指示文(ミヤマさんの投稿): https://x.com/mmmiyama_d/status/2094551241334628639

MiniMaxの指示文を一字も変えなかった理由

  • た〜やさんの作例が出ていた時点で、この指示文と開始画像の組み合わせが「動く」ことは確認済みだった
  • 変数を増やすと、うまくいかなかったときに「指示が悪いのか・画像が合わないのか・ツールの相性か」の切り分けができなくなる
  • 指示文には「文字を繰り返さない」「参照画像の文字を化けさせず、綴りや語を変えずに忠実に再現する」と書かれている。文字の扱いが最初から焦点になっている指示文だった

MiniMax用の指示文全文(た〜やさんが公開していた原文のまま)

Commercial film.

Maintain the initial background color throughout the sequence.

The camera smoothly tracks the character with a continuous horizontal scrolling movement, moving alongside them as they walk.

Text and connecting lines progressively appear across the screen, forming a continuous visual pathway.

As the character walks, they recognize the text and graphic elements appearing around them as physical objects that actually exist within the same space. They naturally interact with these elements as they move forward: occasionally tapping nearby text with a fingertip, looking up at words above them, glancing sideways at graphics, slightly stepping aside to avoid an element, ducking underneath one, or briefly stopping to observe something.

A continuous line, resembling a railway track or visual route, connects one text element to the next. The text from the reference image appears sequentially along this connected path, following the original order.

The text and graphic elements must not feel like flat background decorations. They should feel physically present in the same three-dimensional space as the character, with convincing spatial relationships and interaction.

Do not repeat or duplicate any text.

Keep the overall pacing fast, rhythmic, and fluid. The horizontal scrolling movement should remain continuous and uninterrupted throughout the sequence.

Faithfully reproduce all text from the reference image without garbled characters, corrupted typography, misspellings, or altered wording.

For the final transition, a large foreground object or graphic element passes very close in front of the camera, completely covering the entire frame and creating a natural foreground-blur wipe transition.

As the foreground object clears the frame, seamlessly reveal the final logo screen.

Camera movement should be smooth, dynamic, and cinematic.

Prioritize the interaction between the character and the text / graphic elements above everything else.

BGM: Up-tempo, rhythmic music with a strong beat.

原文(た〜やさんの投稿): https://x.com/taya_mama_AI/status/2096612096003965254


締めのつなぎ目を1コマずつ並べた画像。緑の「6」の駅マークが画面いっぱいに広がった瞬間に、正式ロゴのカードへ切り替わっている

映像は1.15倍速、締めだけ差し替えた

生成した1本目をそのまま使わずに、2か所だけ手を入れました。

導入が遅く感じたので、映像だけ1.15倍速にしました。最初はBGMも一緒に速めたのですが、曲まで急いで聞こえて変だったので、音は元のまま・映像だけ速くする形に切り替えました。

締めのロゴ画面は、AIが描いたロゴを正式ロゴのカードに差し替えました。つなぎ目は緑の「6」の駅マークが画面いっぱいに広がった瞬間で切りました。AIのロゴは「6」の裏に最初から描かれていて、後から正式ロゴを被せると1コマだけ覗いてしまうので、「6」が完全に画面を覆った瞬間を切り替え点にしたのです。


4回やって見えてきた、動画の文字崩れとの向き合い方

「プロンプトを工夫すれば直ると言う人もいるけれど、同じ指示で毎回違う崩れ方をするなら、工夫しても運任せでは?」という疑問も出ていました。3回目までの私は、まさにその「工夫すれば直る」側にいました。

今回の記録から、自分なりに3つ整理できました。先に判断の目安を1つだけ書いておくと、「同じ箇所が2〜3回続けて崩れたら、指示の直しではなくツールの変更を考える」です。

その1|文字が崩れるかどうかは、指示の書き方より「どのAIに・文字をどう置かせるか」の影響が大きかった

同じ「⑥AI活用」が、Geminiで4回崩れ、MiniMaxで3本無傷でした。指示を日本語に変えても、絵コンテに焼き込んでも変わらなかった。粘り方より、見極め方の方が大事だったと思っています。

その2|「もう1回」を重ねるほど、良かった部分も一緒に失う

3回目で「駅ごとの動作」は効いたのに、4回目に方式を変えたら、その動作は引き継がれず、文字も直りませんでした。生成のやり直しは毎回全部が作り直されるので、良かった部分は残りません。正直に言えば、3回目で手を替えてもよかった。見切りの早さも、腕のうちだと思います。

その3|同じ指示でも毎回違う。2〜3本出して総合で選ぶ前提で動く

内容が良い本と、動きが良い本が別に出ました。最初から「1本で決める」ではなく「2〜3本から選ぶ」前提で動いていた方が、結果的に早く終わります。


まとめ

要点その1|文字崩れはプロンプトだけでは解決しないことがある Geminiで4回試して、指示の言語も形式も変えましたが、同じ文字が同じように崩れ続けました。ツールが「評価していない」と公式に書いている領域にぶつかっていた場合、粘っても結果が変わらないことがあります。

要点その2|ツールごとに得意・不得意がある Geminiは、人物のいない静止した画面の文字なら保てました。「人物と同じ画面に大きな日本語を描く」用途では、今回は届きませんでした。MiniMaxは今回の3本で大きな日本語が無傷でしたが、小さな英字は崩れた。どちらが上でも下でもなく、用途に合わせて選ぶ話です。

要点その3|最初の1本をそのまま使わない前提で動く 2〜3本出して、内容・動き・文字の残り方を総合で判断する。費用は3本で約2.40ドルでした。

あとがき──4回やって1回通った、というのは失敗談ではなく、今の自分の標準作業だと思っています。1回で通ることもあれば、4回かかることもある。それでも記録を残しておくと、次に同じ場面が来たとき「ツールを替えるタイミング」を少し早く判断できます。この記録が、同じところで止まっている誰かの参考になれば嬉しいです。

同じ文字でつまずいた方がいたら、どのAIで何が化けたか、コメントで教えてください。次に書くことのヒントになります。フォローしておくと、この続きの実録が届きます。


あわせて読みたい