お知らせ・ブログ一覧へ戻る

AIナレーションを動画のカットに合わせる手順|1テイクで読ませて秒単位で配置し、はみ出した行だけ音程を保って詰める


AIナレーションを動画のカットに合わせる手順|1テイクで読ませて秒単位で配置し、はみ出した行だけ音程を保って詰める

AIナレーションを動画のカットに合わせる手順|1テイクで読ませて秒単位で配置し、はみ出した行だけ音程を保って詰める

店舗のPR動画や求人動画に、AIの音声合成(TTS=文章を読み上げ音声に変える機能)でナレーションを付ける場面が増えています。声そのものはすぐに作れますが、つまずくのは「場面が切り替わるタイミングに声が合わない」ことです。見出しが出る前に次の台詞が始まったり、前の台詞が終わらないうちに画面が変わったりします。

先に結論を書きます。

  • 映像のカットは動かさず、声のほうを合わせます。 音楽の拍に合わせて切り替わる動画は、カットをずらすと音とずれます。
  • 最初に「配置表」を作ります。 行ごとに「何秒から読み始め、何秒までに言い終えるか」を決めておき、はみ出しを機械で検出できるようにします。
  • 台本は全文を1回で読ませ、無音の位置で行に切り分けます。 行ごとに作るより、声の調子と抑揚がそろいます。
  • 枠からはみ出した行だけ、音の高さを変えずに速めます。 当社は上限を1.15倍前後に置いており、実際に必要だったのは最大1.12倍でした。上限を超えるなら、台本を削るのが安全です。
  • 声の下でだけBGMを8〜9dBほど下げ、最後に完成した音声(音楽込み)を書き起こして確かめます。 読み間違いと「音楽に埋もれて聞こえない」を同時に見つけられます。

以下の数字は、当社が2026年9月に作った店舗PR動画・ツール紹介動画・求人動画(15〜70秒)での実測です。音声は主にGeminiの音声合成で作りましたが、配置から検品までの手順は、どの音声合成サービスでも同じように使えます。

声を映像に合わせるか、映像を声に合わせるか

最初に決めるのは、どちらを固定するかです。

動画の作り 固定するもの 合わせ方
音楽の拍に合わせてカットが切り替わる 映像と音楽 声を各カットの枠に収める
写真や画面を順に見せるだけで、音楽の拍と関係がない 声 声の長さに合わせてカットを伸ばす

20秒の店舗PR動画は、1分間に120拍の音楽に合わせて、2.5秒・4.5秒・6.5秒……と2秒ごとにカットが切り替わる作りでした。カットを0.3秒ずらすと、文字が出る瞬間と音のアクセントがずれます。このような動画では、映像側は一切動かさず、声を2秒の枠に収めます。

逆に、音楽の拍に合わせていない説明動画なら、声を先に作り、その長さに合わせてカットを伸ばしたほうが自然です。この記事では、手間がかかる前者(映像と音楽が決まっている動画に声を合わせる場合)を説明します。

手順1:配置表を先に作る

台本を書いたら、音声を作る前に、行ごとの「置く秒」と「言い終える秒」を表にします。次の表は、2.5秒・4.5秒・6.5秒でカットが切り替わる動画を想定した例です(数字は説明用)。

行 台詞 読み始め 言い終える上限
1 (店名の紹介) 0.2秒 2.3秒
2 (価格の訴求) 2.4秒 4.3秒
3 (所要時間の訴求) 4.4秒 6.3秒

決め方の目安は次のとおりです。

読み始めは、その行の見出しが画面に出る直前に置きます。 当社はこの順にしています。声が先に聞こえ、直後に文字が出るので、聞いた内容をそのまま文字で確かめる流れになります。

言い終える上限は、次のカットの切り替わりより少し前に置きます。 音楽が一瞬止まる「溜め」の箇所や、効果音が鳴る箇所がある場合は、そこに声が食い込まないよう、上限をさらに手前にします。

この表は、あとで機械的な検査に使います。「言い終える上限」を数字で持っておけば、配置したあとに「声が上限を超えていないか」「隣の行と重なっていないか」をプログラムで確かめられ、目で波形を見比べる必要がなくなります。

手順2:台本の全文を1回で読ませ、行に切り分ける

音声は1行ずつ作るのではなく、台本の全文を1回のリクエストで読ませます。

1回の読み上げの中で作った声は、行と行の間で声の調子や抑揚がそろいます。1行ずつ別に作ると、行ごとに声の高さや勢いが微妙に変わり、つなげたときに継ぎはぎに聞こえることがあります。無料枠で使う場合は、回数の節約にもなります。

切り分けのポイントは3つです。

  • 声の指示に「行間は1秒ほど間を取る」と書いておきます。 行の切れ目が長い無音になり、切り分けやすくなります。
  • 無音の位置で区切ったら、区切った数が行数と合っているかを必ず数えます。 句点や読点で長めの間が入ると、1行が2〜3個に割れることがあります。20秒の動画では9行の台本が12個に割れたため、どれがどの行かを対応表にして9行に束ねました。
  • 製品名など読みの決まっている言葉は、最初からカタカナで渡します。

無音の判定の数値や、数が合わないときの対応表の作り方は、Geminiの音声合成を無料枠で使うときの上限で詳しく説明しています。

手順3:秒の位置に置き、はみ出した行だけ詰める

切り分けた行を、配置表の「読み始め」の秒に置きます。そのうえで、行ごとに「読み始め+声の長さ」が「言い終える上限」に収まるかを確かめます。

収まらない行だけ、音の高さを変えずに再生速度を上げます。動画編集でよく使われるffmpeg(動画や音声を加工する無料のツール)の場合、atempo という処理を使うと、声が高くならずに速さだけが変わります。単純に再生速度を上げると声が高くなり、別人の声のように聞こえるので避けます。

速める倍率には上限を決めておきます。

項目 当社の設定・実績
速める倍率の上限 1.15倍を目安(作業によっては1.3倍まで許容)
実際に必要だった倍率 最大1.11倍(15秒)、最大1.12倍(20秒)

上限を小さく置くのは、早口で聞き取りにくくなるのを避けるためです。上限を超えるほど詰めないと収まらない行は、台本の言葉が多すぎると考えられます。速めずに台本を短くして作り直すのが安全です。

はみ出していない行は、速めずにそのまま置きます。全行を同じ倍率で速めると、余裕のある行まで早口になります。

動画編集アプリで手作業する場合も、考え方は同じです。タイムラインのカットの切り替わり位置に印を付け、声のクリップを印の直前に並べます。はみ出したクリップだけ速度を上げますが、その際は速度を変えても音の高さを保つ設定があるかを、使っているアプリで確認してください。

最後に、配置表を使って次の2点をプログラムで確かめます。どちらかが外れたら、書き出しへ進まずに止めます。

  • すべての行が「言い終える上限」までに終わっている
  • どの行も、次の行の読み始めより前に終わっている(声が重ならない)

手順4:BGMを声の下でだけ下げる

声を置いたら、声が鳴っている間だけBGMを下げます。この処理をダッキングと呼びます。BGMを全体的に小さくすると動画の勢いがなくなるため、声のある区間だけ下げるのがポイントです。

当社の設定は次のとおりです。

項目 設定
下げる量 BGMを8〜9dB下げる
下げ始め 声の始まりに合わせて0.015秒ほどで素早く下げる
戻し 声が終わってから0.35秒ほどかけて戻す
声の大きさ 声のある区間のBGMの音量より、8dBほど大きく

戻しを速くしすぎると、行と行の間でBGMが急に大きくなり、音量が揺れて聞こえやすくなります。当社は0.35秒ほどかけて戻しています。

BGMを自分で作っている(伴奏・打楽器・効果音を別々の音として持っている)場合は、音ごとに下げる量を変えられます。15秒のPR動画では、伴奏を8dB、打楽器を4dB、効果音を3dB下げました。メロディーの伴奏だけをしっかり下げ、打楽器と効果音は少しだけ下げると、映像の勢いを残したまま声が前に出ます。

映像はすでに完成しているので、音声だけを差し替えて書き出します。ffmpegなら映像を再エンコードせずにそのままコピーでき(-map 0:v -c:v copy)、画質が落ちず、書き出しの時間も短く済みます。

手順5:完成した音声を書き起こして確かめる

最後の検品は、声だけでなく、BGMと効果音を混ぜた完成版の音声を、AIに文字へ書き起こさせて行います。音を聞く担当者の耳だけに頼らず、台本と文字で突き合わせられるようにするためです。

書き起こしで分かることは2つあります。

  • 読み間違いが分かります。 台本と書き起こしを並べると、違う読み方をした箇所が浮かびます。機能紹介動画では、書き起こしで「口調」が「とくちょう」と読まれていたのが見つかり、その語をひらがなにした1行だけ作り直しました。
  • 音楽に埋もれた箇所が分かります。 声が小さすぎたりBGMが大きすぎたりすると、その部分は書き起こしで欠けたり、別の言葉になったりしやすく、聞き取りにくさの目安になります。

書き起こしは、ひらがなで出させると読み方を比較しやすくなります。20秒の動画では、完成版の書き起こしで9行すべてが台本どおりに聞き取れることを確かめてから仕上げました。

ただし、書き起こしだけで十分とは考えないでください。全体をまとめて書き起こすと、原稿に無い言葉が足されていても、原稿どおりに見えて見落とすことがあります。手順3の長さと重なりの検査、行ごとの書き起こしと組み合わせ、最後に人の耳でも一度通して聞きます。

書き起こしに使うAIは、一時的に混み合ってエラー(503)を返すことがあります。当社の環境では3回まで再試行すれば通りました。

起こりうる失敗と、先に入れておく予防策

配置の手順を守っていても、次のような失敗は起こりえます。どれも「エラーにならずに、それらしい動画ができてしまう」ため、先に検査を入れておきます。

声が重なって輪唱のように聞こえる

音声合成のモデルによっては、台本に混ぜた声の指示まで読み上げ、1行が想定の何倍もの長さになることがあります。この音声を数秒の枠に置くと、前の行が終わらないうちに次の行が始まり、輪唱のような動画になります。

台詞と指示を分ける方法と、配置前に長さを測る検査はGeminiの音声合成を無料枠で使うときの上限で説明しています。カットに合わせる作業では、手順3の重なりの検査が最後の防波堤になります。

違う場面に違う台詞が乗る

切り分けた数が行数と合わないまま配置すると、台詞が1つずつずれて、価格の場面で所要時間の話をする、といった動画になります。手順2のとおり、数が合わないときは先へ進まずに止めます。

書き出しの圧縮で声が痩せる

ホームページに載せるために動画を軽くするとき、映像と一緒に音声まで強く圧縮すると、ナレーションがこもって聞こえることがあります。美容室の求人動画では、14MBの動画を5.4MBまで軽くしましたが、ナレーションが主役なので音声の圧縮は控えめにし(音声は171kbpsを確保)、圧縮の前後で平均の音量がほぼ変わらない(−14.5dB→−14.6dB)ことを確かめました。動画全体の音の大きさは、機能紹介動画では−14LUFS(配信サービスでよく使われる音量の目安)にそろえています。

サイトに置いたら声が出ない

多くのブラウザでは、ホームページの動画を自動再生させるのに音を消す設定(muted)が必要です。ナレーションが主役の動画にこの設定を付けると、肝心の声が聞こえません。求人動画では自動再生を使わず、再生ボタンを押してもらう形にして、動画の下に「ナレーション・音声が流れます」と書き添えました。スマホでの再生の設定は、サイトの動画がスマホで再生されないときにまとめています。

状況別の判断基準

状況 対処
枠を少しはみ出す(上限の倍率以内で収まる) その行だけ音の高さを保って速める
上限の倍率でも収まらない 台本を短くして作り直す
切り分けた数が行数と合わない 書き起こしで対応表を作って束ねる。合うまで配置しない
一部の語の読みが違う その語をひらがなにした1行だけ作り直す
完成版の書き起こしで一部が欠ける その区間の声を上げるか、BGMを下げる量を増やす
声の長さが枠を大きく超える(当社の基準は無音を除いて1.8倍超) 使わない。台詞と指示の分け方を見直す

まとめ

  • 音楽の拍に合わせて切り替わる動画は、映像を動かさずに声を合わせる
  • 先に配置表を作り、行ごとに「読み始め」と「言い終える上限」を決める。はみ出しと重なりはプログラムで検査する
  • 台本は全文を1回で読ませて無音で切り分け、行数と合っているかを数える
  • はみ出した行だけ音の高さを保って速める。上限は1.15倍前後、超えるなら台本を削る
  • BGMは声の下でだけ8〜9dB下げ、0.35秒ほどかけてゆっくり戻す
  • 最後にBGM込みの完成版を書き起こし、読み間違いと聞き取りにくい箇所をつぶす

ナレーションを付ける前の素材づくりは、静止画バナーをAIで動画広告にする手順とスタッフ向けの説明動画は撮ったまま渡さないにまとめています。店舗のPR動画や求人動画づくりで迷ったときは、graciautoまでご相談ください。

関連記事

2026.10.04

発注の記録を月別に集計する表は元のシートと分けて作る|元データはIMPORTRANGEでつなぎ、月ごとのシートは「対象月」のセル1つで切り替える作り方と、件数・数量の検算

2026.10.04

多店舗の店舗一覧ページは地図とテキストの一覧を両方置く|県→エリア→ピンで選ばせる地図と、HTMLに最初から書いた店舗カードの作り方、公開前に電話・営業時間・予約先を突き合わせる手順

2026.10.03

実績の画面をSNSに載せるときの匿名化|市名だけ伏せても駅名・地名で店は分かる。店名は丸ごと置き換え、文字認識で実名の残りを機械的に照合する手順


お知らせ・ブログ一覧へ戻る