AI 视频提示词写作实战指南

June 2, 2026
一套实用的 AI 视频提示词写作框架——主体、场景、动作与镜头语言,外加适用于 Kling、Veo、Sora 和 Seedance 的时长、画幅与负面提示词技巧。
提示词技巧
AI 视频
教程
指南

视频提示词与图像提示词,是两种不同的技能

图像提示词描述的是一帧画面。视频提示词描述的则是随时间发生的变化——什么在动、镜头怎么运动、先发生什么后发生什么,而且越来越多时候,还要描述听起来是什么样。要在一两句话里说清楚这么多东西并不容易,这也是为什么那些在静态图像上很好用的提示词习惯(比如"黑色大理石上的一根金色香蕉,影棚灯光"),放到视频里往往会生成画面死板、缺乏生气的片段。

解决办法不是把提示词写得更长,而是让它更有结构。

五个构成要素

在本平台上,每一条优秀的视频提示词基本都会按下面这个顺序,覆盖五个要素:

  1. 主体——画面里是谁、是什么。要具体描述外观,而不只是给个类别:"一位穿红色风衣的女性",而不是"一个人"。
  2. 场景——在哪里、什么时候。时间和地点能免费为画面增添大量信息:"雨后的东京十字路口,夜晚",比"一座城市"能告诉模型多得多的信息。
  3. 动作——片段里究竟发生了什么。视频模型渲染的是运动,所以要给它运动去渲染:行走、转身、伸手去拿杯子、蒸汽升腾。
  4. 镜头语言——画面如何取景、如何运动(见下方速查表)。这是大多数人会漏掉的、性价比最高的一项。
  5. 风格与灯光——视觉处理方式:电影感、手持纪录片风格、黄金时刻、霓虹灯光、黑白胶片颗粒感。

一条精简却完整的提示词,能在一两句话里覆盖全部五个要素:"一位金色香蕉宇航员缓缓飘过土星环,镜头缓慢环绕,电影感灯光,远景镜头,画面透出宏大与寂静之感。" 主体(香蕉宇航员)、场景(土星附近)、动作(飘浮)、镜头(缓慢环绕、远景)、风格(电影感,"寂静"暗示了氛围与声音)。

镜头语言速查表

视频模型对真正的电影摄影术语反应很好,因为这些词汇在训练数据里大量出现。以下几个词可靠好用:

  • 环绕镜头 / 弧形运镜(Orbit / arc)——镜头围绕主体转动
  • 推镜头 / 拉镜头(Dolly in / dolly out)——镜头本身朝主体靠近或远离(这和变焦(zoom)不同,变焦时机位不动,只是焦距在变)
  • 急速推镜(Crash zoom)——快速、戏剧化的推近
  • 固定镜头(Static / locked-off)——镜头完全不动,适合让动作本身撑起整个画面
  • 手持镜头(Handheld)——轻微的自然晃动,读起来像纪录片或跟拍素材
  • 航拍掠过(Drone / aerial pass)——从空中掠过的大幅度运动
  • 焦点转移(Rack focus)——画面内的焦点从一个主体转移到另一个主体
  • 慢动作(Slow motion)——不言自明,但明确写出来仍然很重要

选一个,最多两个。把五种镜头运动硬塞进一个 5 秒的片段,只会让结果变得混乱。

围绕时长与画幅做规划

本平台上的每个模型都有一份固定的片段时长菜单,而不是一个可以随意拖动的滑块,写提示词之前先了解这份菜单很值得:

  • Kling——5 秒或 10 秒
  • Veo 3.1——4 秒、6 秒或 8 秒
  • Sora 2——4 秒、8 秒或 12 秒
  • Seedance——5 秒或 10 秒

更短的片段适合承载单一、干净利落的动作——一件产品转动、一只手伸入画面、一个手势。更长的片段可以承载一个小的连续动作(比如某人走进画面、坐下、端起杯子),但如果你按顺序描述这套动作,效果会更好,因为模型实际上是在根据你的文字规划一份迷你分镜表。

画幅比例应该匹配片段的最终用途,并且要在生成之前就定好,而不是生成后再裁切:

  • 16:9——适合 YouTube、落地页和传统视频位
  • 9:16——适合 TikTok、Reels 和 Shorts
  • 1:1——适合信息流帖子

负面提示词:说清楚不该发生什么

本平台上的 Kling、Veo 3.1 和 Wan 都支持负面提示词——一个独立字段,专门用来填写你希望模型主动避免的内容,而不是把"没有文字、没有水印、不要模糊"这类要求硬塞进主提示词里,跟你真正想要的内容互相争夺注意力。遇到反复出现的问题时用它最合适:变形的手、多余的肢体、文字瑕疵、运动模糊,或者悄悄混入了你没要求过的风格。

图生视频与文生视频的提示词写法

如果你要用图生视频给一张现成的照片赋予动态,就不用再写主体和风格描述了——图像本身已经把这两者都定义好了。把整条提示词都花在动作本身上:"缓慢推近,杯中蒸汽升腾,镜头轻轻晃动。"重新描述照片里已经存在的内容没有帮助,反而可能和模型看到的画面产生冲突。

而对于纯粹的文生视频,你是在从零定义一切,所以上面完整的五要素结构不是不重要,而是更加重要。

像真正在意结果一样去迭代

把你的第一次生成当作草稿,而不是最终答案。一个实际有效的迭代循环:

  1. 写一条包含全部五要素的精简提示词,生成一次。
  2. 看看哪里不对——通常是镜头运动、节奏,或某个具体的视觉细节。
  3. 每次只增加或调整一处,而不是把整条提示词推倒重写。如果动作没问题、只是灯光偏平淡,那就只动灯光相关的措辞。

写 AI 视频提示词,更像是在做导演,而不是写一句配文。你能把一个真正的摄影师会做的事情描述得多精确,最终结果就能多接近你脑海中的画面。想看看每个模型在这些提示词上的实际表现,可以参考我们的 Kling、Veo、Sora 与 Seedance 对比评测

AI 视频提示词写作实战指南 | Nano Banana