AIを使って動画スクリプトを作成する方法を学びましょう。プロンプトの構成からスクリプトの長さ、AIが間違える点、そして完成したスクリプトを動画に変換する方法までを解説します。
AIを使った動画スクリプトの書き方:実践ガイド
言語モデルに動画スクリプトを依頼すると、約4秒でスクリプトが返ってくる。しかし、そのスクリプトが使えるかどうかを尋ねると、たいてい答えは「いいえ」だ。
下書きは、誰もスクロールを止めてまで読みたくなるような魅力的なフック、すべて同じ長さの文章、そして最後に無理やり付け加えられた行動喚起で構成されています。まるで誰かが声に出して書いたブログ記事のようです。これはモデルの欠陥ではありません。一般的なライティングツールに、フォーマットに関する情報がないまま特殊なフォーマットを要求した場合に起こる現象です。
修正とは、より優れたツールのことではありません。重要なのは、生成前に何を指定すべきか、そして生成後に何を修正すべきかを把握することです。
動画スクリプトに実際に含めるべき内容

動画スクリプトは散文ではありません。視聴者が何を聞いて何を見るかを秒単位で指示するものです。実用的なスクリプトには、最初の5秒で視聴者の興味を引く仕掛け、明確なアイデア、ナレーション、各セクションの視覚的な説明、そして行動喚起(コールトゥアクション)という5つの要素が含まれています。
その定義が重要なのは、何がうまくいかないのかのほとんどを説明できるからだ。AIは文章を書くのが得意だ。しかし、文章を声に出して読むと、台本になるのではなく、人が記事を読んでいるように聞こえる。
2つのフォーマットを区別する2つの特性は以下のとおりです。
- 動画は直線的でスキップできません。読者は必要なセクションにジャンプできます。視聴者は、設定したペースで次に続く内容を受け取ることができます。再読を必要とする内容は、簡略化するか削除する必要があります。
- 動画は2つのチャネルで同時に意味を伝える。ナレーションと映像は連携して機能し、どちらか一方しか指定しない脚本では、動画の半分が未定義のままになってしまう。
ステップ1:プロンプトを表示する前にビデオを定義する
ほとんどの質の低いAIスクリプトは、質の低い入力から生じます。「メールマーケティングに関するスクリプトを作成する」という指示を与えられたモデルは、長さ、対象読者、プラットフォーム、目的などを把握できないため、これまで見てきたすべてのメールマーケティングスクリプトの統計的な平均値を生成します。この平均値こそが、人々が不満を漏らすような、ありきたりな原稿なのです。
プロンプトに必要な4つの入力項目
ツールを開く前に、以下の点を決定してください。
- 観客—「マーケター」ではなく、「既にキャンペーンを実施していて、開封率を向上させたいと考えている小規模代理店のマーケター」。
- ゴール視聴者がその後、何を理解し、何を感じ、何をするべきか。結果は一つであって、三つではない。
- プラットフォーム30秒の縦型動画と5分間のYouTube解説動画では、構成、ペース、そして視聴者の興味を引く要素が異なってくる。
- トーン指導的、会話的、権威的、それともエネルギッシュ?どれに当てはまりますか?
これら4つの分野における具体性は、他のどの変更よりも脚本の質を高める効果が大きい。
まず、脚本の長さを決めましょう
これはほとんどの人が飛ばしてしまうステップであり、他の何よりも多くの書き直しを引き起こす原因となる。
ナレーションのペースは1分あたり約140語が目安です。目標再生時間から逆算すると、必要な語数は以下のようになります。
- 15秒— 35語
- 30秒— 70語
- 60秒— 140語
- 90秒— 200~220語
- 3分— 400~450語
- 5分— 700語
指示に数字を盛り込んでください。「60秒の脚本を書く」と指示されたモデルは、話の長さを正確に把握していないため、たいてい長すぎます。「140語のナレーションを書く」と指示されたモデルは、はるかに高い確率で目標に収まります。
ランタイムを決定する前に、制作ツールの上限を確認してください。VidSpotAI のAIビデオジェネレーター最大10分間の動画を生成できるため、15秒の縦型クリップから長尺の解説動画まで、あらゆるものに対応できます。そのため、スクリプトの長さはツールではなく、テーマによって決まります。
ステップ2:使える下書きが書けるようなプロンプトを作成する
曖昧な指示からは曖昧なスクリプトしか生成されない。以下の構造は、モデルが必要とするすべての要素を事前に読み込む。
効果的なプロンプト構造
Write narration for a [length]-word video script.
Audience: [specific description]
Goal: [what the viewer should do or understand]
Platform: [YouTube / TikTok / LinkedIn / product page]
Tone: [instructional/conversational/authoritative]
Structure:
- Hook (first 5 seconds): [the problem or payoff]
- Body: [2 to 4 key points]
- Close: [single call to action]
Write for the ear. Short sentences, contractions, no
subheadings, no bullet points in the narration itself.
最後の行は見た目以上に重要です。それがなければ、モデルはデフォルトで文章形式になってしまいます。つまり、見出し、リスト、括弧付きの補足説明など、声に出して読むと意味をなさないものになってしまうのです。
シーンごとに生成し、一度にすべて生成しない
完全なスクリプトを1つの出力で要求すると、フックと3番目のサポートポイントが同じ重み付けを受けるような、均等な重み付けの結果になります。部分ごとに生成する方がより良い結果が得られます。
- まず、フックのオプションを5つ生成します。その中から1つを選ぶか、2つを組み合わせます。
- 選択したフックに対してボディを生成する。
- 結びの部分は別に記述し、行動喚起が冒頭で提示した具体的な約束と一致するようにしてください。
これにはわずかに時間がかかるものの、より強力なオープニングを生み出すことができ、オープニングこそがその後の展開を左右する重要な要素となる。
ステップ3:AIが繰り返し間違える点を修正する
生成されたスクリプトはすべて編集作業が必要です。デフォルトでチェックすべき、確実に発生する4つの問題点があります。
汎用フック
「今日の目まぐるしく変化するデジタル世界では」や「あなたはこれまで疑問に思ったことはありませんか」は統計的な平均値であり、書き出しとしては適切ではありません。最初の行を、あなたのテーマに特有の内容、例えば数値、矛盾点、あるいは問題点を直接的に述べたものに置き換えてください。
均一な文のリズム
自動生成されたナレーションは、文の長さが似通っている傾向があり、声に出して読むと機械的に聞こえます。意図的にそのパターンを崩しましょう。長い説明文の後に短い説明文を続けて置いてみてください。下書きを声に出して読んでみると、単調な部分がすぐに明らかになります。
詳細情報が不足しています
モデルは、平均値が示すような一般的な表現であるため、安全で一般的な記述を生み出します。あなたのスクリプトに必要なのは、あなただけが知っている詳細情報です。つまり、実際の数値、具体的な例、使用したツール、そして実際に起こった出来事です。一般的な記述を具体的な記述に置き換えるたびに、スクリプトの信頼性は高まります。
フックと合致しない行動喚起
AIは、冒頭の約束とは無関係なデフォルトのCTAで締めくくることが多い。もし冒頭で問題解決を約束していたなら、締めくくりはその解決策を示すべきであり、ニュースレターの登録を促すべきではない。
ステップ4:制作用にスクリプトをフォーマットする
ナレーションのみの脚本では、視覚的な要素に関する決定事項が一切含まれません。2段組フォーマットはこの問題を解決し、作成も数分で完了します。
2段組のスクリプト
- ナレーション:「ほとんどのメールキャンペーンは、件名が表示される前に失敗する。」ビジュアル:受信トレイのクローズアップ、未開封メッセージ
- ナレーション:「問題はコピーではなく、タイミングだ。」ビジュアル:画面分割、送信時間2回
- ナレーション:「火曜日に開催日を変更したことで、何が変わったのかを以下に説明します。」ビジュアル:オープンレートの変動を示すグラフ
上の各行は1つのシーンを表しています。左の列は視聴者が聞く音声、右の列は視聴者が見る映像です。シーンの長さは約5秒から15秒なので、90秒の動画には8行から12行が必要です。
ビジュアルに関する指示を自分で書くことが重要です。それは、映像を生成または取得するあらゆるものへの指示となるため、曖昧な指示では曖昧な映像しか生まれません。その指示がストックライブラリに送られる場合でも、VidSpotAIのような生成プラットフォームに送られる場合でも、適切な欄にどれだけ具体的に記述するかが、最終的な出力があなたのイメージにどれだけ近いものになるかを左右します。
先に進む前に声に出して読んでください
これは利用可能な品質チェックの中で最も効果的な方法であり、費用は動画の長さ分です。
台本は普段の話し言葉と同じペースと時間で読んでください。つまずくような文章は長すぎます。単調に感じる部分はリズムに変化をつける必要があります。普段口に出さないような言葉は別の言葉に置き換えてください。もし時間がオーバーするようなら、制作後ではなく今すぐにカットしてください。
ステップ5:完成したスクリプトをビデオに変換する
2段組の台本が完成すると、制作は創造的な作業というより機械的な作業へと移行する。台本には、セリフの内容や画面に映る映像がすでに明記されているからだ。
ほとんどの動画は、以下の2つのルートでカバーされています。
- プレゼンターが原稿を読み上げている。スーツの説明、意見記事、そして実演よりも権威が重要なあらゆる場面。AIアバターを使えば、撮影なしで実用的に実現できます。VidSpotAIにはAIアバターProプランでは、リップシンク機能付きのスクリプト生成が可能で、プレゼンター主導の完成済みスクリプト配信に対応しています。
- 各ビジュアルメモに対応する映像を生成しました。工程説明、製品コンテンツ、具体的な内容を示すあらゆるものに適しています。ここでは、ビジュアルコラムが直接生成のきっかけとなるため、具体的に記述することが効果的です。
モデルの選択は、出力が視覚的な意図にどれだけ合致するかに影響します。VidSpotAIは、Veo、Kling、Runway、Luma、Pixverse、Hailuo、Haiper、Seedance、Hunyuan、Midjourneyなど、複数の生成モデルを単一のインターフェースを通してルーティングするため、あるモデルでうまくいかなかったシーンでも、別のモデルで再生成することができ、そのまま受け入れたり、諦めたりする必要はありません。
スクリプト作成段階で知っておくべき重要な点の一つは、40以上の言語に対応しているため、ある言語で動作するスクリプトを、構造を書き直すことなく他の言語でも作成できるということです。つまり、1つのスクリプトから複数のローカライズされた動画を作成でき、複数の別々の文章作成作業を行う必要がなくなります。
生成後の調整は、すべてのプランに含まれるブラウザエディタで行えます。長すぎるシーンやナレーションが欠落しているクリップなどは、ビデオを再構築することなく修正できます。
AIを使って動画スクリプトを作成する際によくある間違い

以下は、AIを使って動画スクリプトを作成する際に人々が犯しがちな最も一般的な間違いと、それぞれの間違いが最終結果を損なう理由です。
最初の草稿を受け入れる
最初の出力はあくまで出発点です。編集せずに公開してしまうことが、AIが作成した動画が平凡に感じられる最も一般的な原因です。
耳ではなく目で読むための文章
小見出し、箇条書き、括弧書きの補足説明は文書には必要ですが、声に出して読むと不自然に聞こえます。
長さの計算をスキップします
文字数制限なしで書かれた脚本はほぼ必ず長くなり、制作後にカットする費用は制作前にカットする費用よりもはるかに高額になる。
ビジュアル列を空のままにする
ナレーションだけでは脚本の半分しか完成しない。映像を生成するものには必ず演出が必要であり、「オフィスシーン」は演出とは言えない。
動画ごとに1つのプロンプトを使用する
30秒のソーシャルメディア動画向けに調整されたプロンプトでは、質の低い5分間の解説動画しか作れません。トピックだけでなく、構成も調整する必要があります。
実践的な教訓
AIを使って動画スクリプトを作成する場合、モデルをライターではなく、あくまでも下書きツールとして扱うことが重要です。まず、視聴者、目標、プラットフォーム、そしてトーンを明確に定義します。次に、再生時間から文字数予算を計算します。そして、冒頭部分とは別にフック(導入部分)を生成します。最後に、詳細、リズム、そして冒頭部分と調和する締めくくりとなるよう編集します。
編集上の決定は、その後もずっと残る。変わるのは、アイデアを思いついてから、それを記録したり制作したりするまでの時間だ。以前は数時間かかっていたのが、今では数分で済むようになった。
スクリプトが完成すると、制作段階が残りの作業の大部分を占めることになります。VidSpotAI はその段階をカバーします: テキストからビデオへの変換と画像から動画へプレゼンテーション生成機能、プレゼンター主導のセクション用アバター、様々なビジュアルスタイルに対応するモデル選択機能、そして生成後にシーンを調整できるブラウザエディタが利用可能です。各プランには1日間の無料トライアルが用意されています。
よくある質問
AIが生成する動画スクリプトの長さはどれくらいが適切でしょうか?
再生時間から逆算して、1分あたり約140語のペースで計算してください。60秒の動画には約140語のナレーションが必要で、3分間の解説動画には400~450語が必要です。プロンプトで再生時間を指定するよりも、語数を指定する方がより正確な結果が得られます。
AIは単独で完全なビデオスクリプトを作成できるのか?
完全な下書きを作成することはできますが、完成した脚本を作成することはできません。生成された下書きには、明確な導入部、変化に富んだ文のリズム、具体的な詳細、そして冒頭に合わせた行動喚起が必ず必要です。下書きは白紙の状態を保存し、編集作業によってそれを使える状態にします。
動画脚本を書く上で最適なきっかけは何ですか?
最も効果的な指示は、対象読者、目標、プラットフォーム、トーン、目標語数、構成を具体的に指定し、さらにモデルに文字ではなく耳で聞くことを想定して文章を書くように指示するものです。曖昧な指示では、モデルがこれまで見てきたものの平均値を出力してしまうため、ありきたりな文章が生成されます。
台本には視覚的な指示を含めるべきでしょうか?
はい。各ナレーションと視覚的な注釈を組み合わせた2段組のスクリプトによって、ビデオの2つのチャンネルが定義されます。視覚的な列は、映像素材の生成や調達のきっかけにもなるため、具体的に記述することで最終的な仕上がりが向上します。
AIスクリプトがロボットのような話し方にならないようにするにはどうすればいいですか?
機械的な話し方のほとんどは、音声モデルではなくスクリプトに起因しています。句が多くて長い文章ではナレーターに息苦しさを感じさせ、フォーマルな文体は声に出して読むとぎこちなく聞こえます。文章を短くしたり、短縮形を使ったりする方が、ナレーションの設定を調整するよりもずっと効果的です。
