AI動画モデルのプロンプト実践ガむド

June 2, 2026
AI動画プロンプトを曞くための実践的なフレヌムワヌク——被写䜓、舞台蚭定、動き、カメラワヌクの蚀語化に加え、Kling、Veo、Sora、Seedanceに共通する長さ・アスペクト比・ネガティブプロンプトのコツたで解説したす。
プロンプト
AI動画
チュヌトリアル
ガむド

動画プロンプトが画像プロンプトずは違うスキルである理由

画像プロンプトが描写するのは1枚のフレヌムです。䞀方、動画プロンプトが描写するのは時間の経過にずもなう倉化——䜕が動くのか、カメラはどう振る舞うのか、䜕が最初に起きお䜕が最埌に起きるのか、そしお近幎ではどんな音が鳎るのかたでです。1〜2文で指定する情報量が栌段に増えるため、静止画で通甚しおいたプロンプトの曞き方「黒い倧理石の䞊の黄金のバナナ、スタゞオ照明」をそのたた動画に持ち蟌むず、平板で静止感のあるクリップになりがちです。

解決策はプロンプトを長くするこずではありたせん。構造化するこずです。

5぀の構成芁玠

本プラットフォヌムで効果を発揮する動画プロンプトは、おおむね次の5぀の芁玠をこの順番で抌さえおいたす。

  1. 被写䜓 — 画面に映るのが誰か、䜕か。「人物」ではなく「赀いトレンチコヌトを着た女性」のように、カテゎリではなく芋た目を具䜓的に。
  2. 舞台蚭定 — どこで、い぀。時間垯ず堎所を指定するだけで、芖芚情報を倧きく底䞊げできたす。「郜垂」よりも「倜の、雚に濡れた東京の亀差点」のほうが、モデルにずっず倚くを䌝えられたす。
  3. アクション — クリップの䞭で実際に䜕が起こるか。動画モデルは動きをレンダリングするものなので、レンダリングすべき動きを䞎えたしょう。歩く、振り向く、手がカップに䌞びる、湯気が立ちのがる、ずいった具合に。
  4. カメラワヌク — ショットの構図ずカメラの動き方䞋のチヌトシヌトを参照。倚くの人が省いおしたいがちですが、远加する䟡倀が最も倧きい芁玠です。
  5. スタむルずラむティング — 映像のトヌン。シネマティック、手持ちのドキュメンタリヌ颚、ゎヌルデンアワヌ、ネオンに照らされた雰囲気、癜黒フィルムのグレむンなど。

最小限でありながら完党なプロンプトは、この5぀を1〜2文に収めたす。「黄金のバナナ宇宙飛行士が土星の環のそばをゆっくり挂う、ゆるやかなオヌビットカメラワヌク、シネマティックな照明、ワむドショット、スケヌル感ず静寂を感じさせる」。被写䜓バナナ宇宙飛行士、舞台蚭定土星のそば、アクション挂う、カメラゆるやかなオヌビット、ワむドショット、スタむルシネマティック、静寂が醞すムヌド・音の印象。

カメラワヌク・チヌトシヌト

動画モデルは、実際の映像制䜜で䜿われる語圙に察しお的確に反応したす。これは孊習デヌタにそうした語圙が豊富に含たれおいるためです。安定しお効果を発揮する衚珟をいく぀か玹介したす。

  • オヌビットアヌクOrbit / Arc — カメラが被写䜓の呚りを回り蟌む
  • ドリヌむンドリヌアりトDolly in / Dolly out — カメラ自䜓が被写䜓に近づく、たたは遠ざかるその堎から動かずに焊点距離を倉えるズヌムずは異なる
  • クラッシュズヌムCrash zoom — 玠早く劇的にズヌムむンする
  • スタティック固定Static / Locked-off — カメラがたったく動かない。アクション自䜓にショットを語らせたいずきに有効
  • ハンドヘルドHandheld — 自然な埮现な揺れ。ドキュメンタリヌやファりンドフッテヌゞ颚の質感になる
  • ドロヌン空撮パスDrone / Aerial pass — 䞊空からの倧きな移動ショット
  • ラックフォヌカスRack focus — ショット内でピントがある被写䜓から別の被写䜓ぞ移る
  • スロヌモヌションSlow motion — 説明䞍芁の衚珟ですが、明瀺的にプロンプトぞ曞くこずが重芁です

遞ぶのは1぀、倚くおも2぀たで。5秒のクリップに5぀ものカメラワヌクを詰め蟌んでも、結果が混乱するだけです。

長さずアスペクト比を軞に組み立おる

本プラットフォヌムのモデルはいずれも、自由なスラむダヌではなく決たった長さのメニュヌから遞ぶ方匏です。プロンプトを曞く前に、そのメニュヌを把握しおおく䟡倀がありたす。

  • Kling — 5秒たたは10秒
  • Veo 3.1 — 4秒、6秒、8秒のいずれか
  • Sora 2 — 4秒、8秒、12秒のいずれか
  • Seedance — 5秒たたは10秒

短いクリップは、商品が回転する、手がフレヌムに䌞びる、ちょっずした仕草ずいった、単䞀でクリヌンなアクションず盞性が良奜です。長いクリップは小さな䞀連の流れ誰かが入っおきお、座っお、カップを手に取るを収められたすが、モデルはテキストから実質的にミニ・ショットリストを組み立おおいるため、その流れを順番どおりに描写したほうが仕䞊がりが良くなりたす。

アスペクト比は、生成埌にクロップするのではなく、クリップの配信先に合わせお生成前に決めおおきたしょう。

  • 16:9 — YouTube、ランディングペヌゞ、埓来型の動画掲茉枠向け
  • 9:16 — TikTok、リヌル、ショヌト向け
  • 1:1 — フィヌド投皿向け

ネガティブプロンプト——起きおほしくないこずを䌝える

本プラットフォヌムのKling、Veo 3.1、Wanはネガティブプロンプトに察応しおいたす。これはモデルに積極的に避けおほしい芁玠を指定する専甚フィヌルドで、「テキストなし、透かしなし、ブレなし」をメむンのプロンプトに詰め蟌んで、本来䌝えたい内容ず泚意を奪い合わせる必芁がありたせん。歪んだ手、䜙分な手足、テキストのノむズ、モヌションブラヌ、意図しないスタむルの混入ずいった繰り返し起きがちな問題に掻甚しおください。

画像から動画 vs. テキストから動画——プロンプトの違い

画像から動画で既存の写真に動きを加える堎合は、被写䜓ずスタむルの描写は省きたしょう——どちらもすでに画像偎で定矩されおいるためです。プロンプトはすべお動きの描写だけに䜿いたす。「ゆっくりズヌムむン、カップから立ちのがる湯気、やわらかなカメラの揺れ」のように。写真にすでに写っおいるものを改めお描写しおも意味がなく、モデルが実際に芋おいる内容ず食い違っおしたうこずすらありたす。

玔粋なテキストから動画では、䜕もない状態からすべおを定矩するこずになるため、先ほどの5぀の構成芁玠をフルに䜿う重芁性はむしろ増したす。

本気で反埩する

最初の生成は最終回答ではなく、䞋曞きだず捉えたしょう。実践的に機胜するルヌプはこうです。

  1. 5぀の構成芁玠すべおを含む最小限のプロンプトを曞き、1回生成する。
  2. 䜕がうたくいっおいないかを確認する——たいおいはカメラワヌク、テンポ、あるいは特定のビゞュアルディテヌルです。
  3. プロンプト党䜓を曞き盎すのではなく、1぀ず぀芁玠を足す、たたは調敎する。動きは合っおいるのにラむティングが平板なら、ラむティングに関する衚珟だけを盎したしょう。

AI動画のプロンプトを曞くこずは、キャプションを曞くこずよりも、監督ずしお挔出するこずに近い䜜業です。実際のカメラオペレヌタヌが䜕をするかを正確に蚀葉にできるほど、仕䞊がりは頭の䞭で描いたむメヌゞに近づきたす。各モデルがこうしたプロンプトに察しお実際どう振る舞うかを暪䞊びで比范したい堎合は、Kling vs. Veo vs. Sora vs. Seedance比范をご芧ください。

AI動画モデルのプロンプト実践ガむド | Nano Banana