記事一覧
動画制作 AI音声動画制作AivisSpeechVOICEVOX非エンジニアAI活用

AI音声の棒読みは台本で直せた。318行を検査して見つけた誤読7件

note.comでも読む

台本に赤ペンで直しを入れているところ。マイクは脇に置かれ、音の波形が平坦な状態から自然な起伏のある状態へ変わっていく

動画に声を入れたい。でも、自分の声は録りたくない。

そう思って読み上げのAIを探し始めると、今度は別の壁が出てきます。棒読みに聞こえる。イントネーションがどこか変。これを公開して大丈夫だろうか、と手が止まる。

私も同じところで止まって、ツールを4つ試しました。でも、いちばん結果が変わったのは、ツールを選び直したことではありませんでした。台本の読ませ方を直したことでした。

音声にする前に、台本318行の読み仮名を機械で検査したら、誤読が7件出てきました。そのうちのひとつが「一行ずつ」です。「イッコオズツ」と読まれていました。

私がずっと「棒読み」だと思っていたものの中身は、けっこうな割合でこれでした。抑揚が平坦なのではなく、言葉そのものを取り違えて読まれていた。聞いている側は理由が分からないまま「なんか変だ」と感じます。だから、抑揚を調整する前にここを潰すほうが早かったのです。


自分の声は録りたくない。でもAI音声は棒読みになる

自分の声を録音するのは恥ずかしいし、噛むたびに録り直しになります。かといってAI音声にすると、聞いている人に違和感を持たれないか不安になる。この二つのあいだで止まってしまう人は多いようです。

左はマイクの前で緊張して固まっているところ。右はパソコンの画面に起伏のない平らな波形が表示され、「棒読み」と書かれた吹き出しが出ている

Xを見ていると、AI音声に切り替えたら棒読みになってしまい、イントネーションもどこかおかしい、動画の質が下がった気がして、もう諦めようかと思った、という声を見かけます。

私もこの講座を作りながら、同じところを通りました。

私が作っているのは、HyperFrames というツールを使った全6回のYouTube講座です。HTMLで画面を組んで動画にするタイプのもので、非エンジニアの私がなんとか使っているところです。その第4回のテーマが「声と字幕」でした。

講座の中では、視聴者に無料のツールを1つだけ紹介しました。選択肢を並べると「じゃあ手順も違うのか」と、そこで止まってしまう人が出るからです。

ただ、実際の私は1つでは済んでいません。この記事はその補足です。


先に結論:4つをこう使い分けています

  • AivisSpeech(声:morioki) ── 最初の1本に。落ち着いた女性の声。無料で、画面の操作だけで終わります
  • VOICEVOX ── キャラクターの声を使いたいとき。無料で、画面の操作だけ。ずんだもんの解説動画はこれで作っています
  • Gemini TTS(声:Zephyr) ── 長い台本を一度に読ませたいとき。無料の枠で使っています。コマンドを打つ操作が必要です
  • Voicebox ── 自分の声をクローンして使いたいとき。無料で、パソコンの中だけで処理が終わります

4枚のカードが横に並び、左から「最初の1本」「キャラの声」「長い台本」「自分の声」と書かれている

上の3つはテキストを読ませるもの、いちばん下だけは自分の声を写し取るものです。目的が違います。


1つずつ、どう違うか

左は「画面の操作だけ」と書かれた明るいアプリ画面、右は「コマンドを打つ」と書かれた黒いターミナル画面の対比

AivisSpeech(声:morioki)

講座で視聴者に紹介しているのはこれです。無料で、プログラミングの知識もPythonの準備もいりません。画面を操作するだけで終わります。

ライセンスはACML 1.0で、クレジット表記は任意、商用にも使えます。ここが選んだ決め手でした。30秒の動画にクレジットを載せずに済みます。

つまずきやすいところが2つあるので、先に書いておきます。

インストールでつまずいたら、zip版を試してください。 公式が案内しているのはインストーラー版なので、まずはそちらで問題ないと思います。ただ、私が入れた2026年8月時点のこの環境では、Webインストーラ(exe)が取りに行くファイル名と、実際に置いてあるファイル名が食い違っていて、何度やり直しても同じところで止まりました。zip版を展開したら一発で入りました。同じ止まり方をしたときは、これを思い出してください。

書き出しは「音声をつなげて書き出し」を選んでください。 すぐ隣に「音声書き出し」という似た名前の項目がありますが、こちらを押すと行ごとにバラバラのファイルになります。台本5行なら5個のファイルが出てきます。

なお、声の「morioki」は最初から入っているわけではありません。AivisHub という配布サイトから追加します。起動したときの声は別の人になっているので、そこで「入っていない」と勘違いしないでください。

VOICEVOX

キャラクターの声で動画を作りたい人向けの選択肢です。やることはAivisSpeechと変わりません。台本を貼って、声を選んで、書き出す。それだけです。

私がYouTubeに出しているずんだもんの解説動画は、この声で作っています。記事にも何度か貼っているので、聞いたことがある方もいるかもしれません。あの声を「自分の動画でも使いたい」と思ったなら、入口はここです。

ひとつだけ確認してほしいのが規約です。VOICEVOXは声のキャラクターごとに規約が違います。 クレジット表記が必要な声もあります。使う前に、その声の規約を読んでください。

Gemini TTS(声:Zephyr)

実を言うと、私の講座本編のナレーションはこれで作っています。でも、視聴者には勧めていません。コマンドを打つ操作が必要で、最初の1本を作る段階には向かないからです。

気に入っているのは、台本の全文を一度に読ませられるところです。実測で、246文字が一度に43.6秒の音声になりました。

もうひとつ、末尾に1.5秒の無音を自動で足す設定にしてあります。これがないと、音を最後にフェードアウトさせたときに、語尾のセリフごと削れてしまうからです。地味ですが、これを知らないと最後の一言が消えます。

私が使っている無料の枠では、確認した時点で毎分3リクエストほどが上限でした。超えると、しばらく待つことになります。この数字はプランや時期で変わるようなので、自分の環境で確かめてください。

Voicebox

自分の声をクローンできるツールです。無料で、処理はパソコンの中だけで完結します。

私自身の声を10秒ほど読み込ませて日本語をしゃべらせたところ、出来は良かったです。無料でここまでできるのか、と思いました。

ただ、キャラクターの声を再現させようとしたときは声質が変わってしまいました。私が試した声と設定では、Gemini TTSのほうが元の声質に近く聞こえます。そういう理由で、今は使い分けの本線からは外れています。

なお、AI音声で一番名前を聞くのは ElevenLabs だと思いますが、私は使っていません。今の環境で足りていて、乗り換える理由がなかっただけです。使っていないものを評価はできないので、名前だけ挙げておきます。

無料のものと有料のもので自然さがどこまで変わるのか分からず、課金してから「たいして変わらなかった」となるのが怖い。そういう声も見かけます。その気持ちはよく分かります。ただ、私の場合は課金するより先に直すところがありました。


ツールを変えるより、読ませ方を直すほうが効いた

ここがこの記事の本題です。

声が不自然に聞こえると、つい「ツールを変えれば解決するのでは」と考えます。私もそう考えました。でも実際に効いたのは、台本の書き方を直すことでした。

やったのは、音声にする前に読み仮名だけを機械で取り出して、全行チェックするという作業です。318行の台本を検査したところ、7件の誤読が出てきました。

原稿用紙に書かれた「一行ずつ」から矢印が伸び、吹き出しの中に読み上げ結果の「イッコオズツ」が表示されている

  • 「一行ずつ」→ イッコオズツ
  • 「二十分の一」→ ニジュップンノイチ
  • 「三つ目」→ ミツメ
  • 「録らなくて」→ ロクラナクテ
  • 「並べて聞くと」→ 「並べて」が消える

耳で通して聞いているだけでは、なかなか気づけないものばかりでした。とくに「イッコオズツ」は、流れの中で聞くと一瞬なにを言われたのか分からずに通り過ぎます。

直し方にも、やってみて分かったことがあります。

ひらがなに開いても直らないことが多いです。 「一文」を「いちぶん」と書いても、読みは同じでした。効いたのは、語そのものを変えることです。「一文」を「ひとつの文」にしたら通りました。

誤読は助数詞と数詞のまわりに集中します。 行・文・分・目・秒・枚・本。ここを先に見ると、探す時間が短くて済みます。

読点を足しても読みが変わらないことがある、というのも覚えておくと無駄打ちが減ります。

Gemini TTSの場合は、もうひとつ楽な手があります。読み方を指示文のほうに書くやり方です。「本文に出てくる『間』は、すべて『ま』と読んでください」と一行足すだけで、台本も画面に出す文字も漢字のまま保てました。


「直りました」と報告したのに、耳には「あいだ」のままだった

失敗した話も書いておきます。

「間(ま)」という字が「あいだ」と読まれてしまう問題がありました。直ったかどうかを確認するのに、私は音声の文字起こしを使いました。これが間違いでした。

文字起こしは、音から漢字を推定します。だから「あいだ」と発音していても、前後の文脈から「間」という字に書き戻してしまうのです。画面には正しい字が並びます。

それを見て私は「直りました」と報告しました。でも、実際に聞いていた人の耳には「あいだ」のままでした。

同じ音で読み方が二通りある言葉——間、一日、大手、工夫、人気——は、文字起こしでは判定できません。その部分だけ切り出して、最後は人の耳で確かめる必要があります。文字起こしを確認の道具として信用すると、こういう抜け方をします。

似た話がもうひとつあります。読み仮名の検査で分かるのは「どう読むか」だけで、「どう聞こえるか」は分かりません。

「のぞいてみてください」は、表記としては何の問題もありませんでした。でも実際に聞くと、語尾の「くださイ」が跳ねて、子どもっぽく聞こえたのです。命令形の依頼なので、語尾が上がります。「のぞいてみてもらえるとうれしいです」に変えたら落ち着きました。

だから今は、機械の検査と、耳で聞く確認の二段構えにしています。


棒読みが悪いとは限らない

ここまで「不自然さをどう減らすか」を書いてきましたが、ひとつ足しておきます。

棒読み=悪、とも限りません。 ホラー系の動画では、感情を抑えた淡々とした声のほうが怖さが増す、という声もあります。不自然さが効くかどうかは、用途によって変わります。

同じ一本の平らな波形が画面を貫いている。左半分は日当たりのよい部屋、右半分は薄暗い廊下で、同じ声でも場面によって印象が変わることを表している

もうひとつ。長い原稿を読ませようとすると、ツールごとに一度に入れられる量に上限があります。分ける回数が増えるほど、音のつなぎ目が目立ってきます。

だから「自然に聞こえる声」を探しにいく前に、「この動画に合っている声はどれか」を先に決めたほうが、遠回りにならないと思っています。


📺 この記事の内容を動画で見る

ここまでの話を、実際に画面を操作しているところで見られるようにしました。講座の第4回です。

読み上げソフトに台本を貼って書き出すまでと、その声に合わせて字幕を出すところを実演しています。どこを押せばいいかは、文字で読むより動いている画面のほうが早いと思います。

https://www.youtube.com/watch?v=-UrnkcsyDaA


まとめ

私が動画に声を入れるのに使っているのは、この4つです。

  • AivisSpeech(声:morioki) ── 最初の1本ならこれ。無料・画面操作だけ・クレジット表記は任意
  • VOICEVOX ── キャラクターの声を使いたいとき。規約は声ごとに確認する
  • Gemini TTS(声:Zephyr) ── 台本を一度に読ませたいとき。コマンド操作が必要
  • Voicebox ── 自分の声をクローンしたいとき

そして、いちばん伝えたいことをもう一度書きます。ツールを変える前に、台本の読ませ方を見直してみてください。

助数詞と数詞まわりの誤読をひとつ直すだけで、聞きやすさは変わります。ひらがなに開くのではなく、語そのものを変える。確認は文字起こしに任せず、耳で聞く。この3つだけでも、だいぶ違うはずです。

やるなら、次に音声を書き出す前がいちばん安上がりです。書き出したあとで見つかると、音を作り直すところからやり直しになります。台本を開いて、行・文・分・目・秒・枚・本が入っている行だけ拾う。それだけなら数分で終わります。

みなさんはどの声を使っていますか。「この読み方で困った」「こう書いたら直った」という話があれば、コメントで教えてもらえると嬉しいです。フォローしておくと、次の記事が届きます。


あわせて読みたい

「読みにくい」と伝えるだけで直った。AIの文字が写真に負けた日の話