视频提示词与图像提示词,是两种不同的技能
图像提示词描述的是一帧画面。视频提示词描述的则是随时间发生的变化——什么在动、镜头怎么运动、先发生什么后发生什么,而且越来越多时候,还要描述听起来是什么样。要在一两句话里说清楚这么多东西并不容易,这也是为什么那些在静态图像上很好用的提示词习惯(比如"黑色大理石上的一根金色香蕉,影棚灯光"),放到视频里往往会生成画面死板、缺乏生气的片段。
解决办法不是把提示词写得更长,而是让它更有结构。
五个构成要素
在本平台上,每一条优秀的视频提示词基本都会按下面这个顺序,覆盖五个要素:
- 主体——画面里是谁、是什么。要具体描述外观,而不只是给个类别:"一位穿红色风衣的女性",而不是"一个人"。
- 场景——在哪里、什么时候。时间和地点能免费为画面增添大量信息:"雨后的东京十字路口,夜晚",比"一座城市"能告诉模型多得多的信息。
- 动作——片段里究竟发生了什么。视频模型渲染的是运动,所以要给它运动去渲染:行走、转身、伸手去拿杯子、蒸汽升腾。
- 镜头语言——画面如何取景、如何运动(见下方速查表)。这是大多数人会漏掉的、性价比最高的一项。
- 风格与灯光——视觉处理方式:电影感、手持纪录片风格、黄金时刻、霓虹灯光、黑白胶片颗粒感。
一条精简却完整的提示词,能在一两句话里覆盖全部五个要素:"一位金色香蕉宇航员缓缓飘过土星环,镜头缓慢环绕,电影感灯光,远景镜头,画面透出宏大与寂静之感。" 主体(香蕉宇航员)、场景(土星附近)、动作(飘浮)、镜头(缓慢环绕、远景)、风格(电影感,"寂静"暗示了氛围与声音)。
镜头语言速查表
视频模型对真正的电影摄影术语反应很好,因为这些词汇在训练数据里大量出现。以下几个词可靠好用:
- 环绕镜头 / 弧形运镜(Orbit / arc)——镜头围绕主体转动
- 推镜头 / 拉镜头(Dolly in / dolly out)——镜头本身朝主体靠近或远离(这和变焦(zoom)不同,变焦时机位不动,只是焦距在变)
- 急速推镜(Crash zoom)——快速、戏剧化的推近
- 固定镜头(Static / locked-off)——镜头完全不动,适合让动作本身撑起整个画面
- 手持镜头(Handheld)——轻微的自然晃动,读起来像纪录片或跟拍素材
- 航拍掠过(Drone / aerial pass)——从空中掠过的大幅度运动
- 焦点转移(Rack focus)——画面内的焦点从一个主体转移到另一个主体
- 慢动作(Slow motion)——不言自明,但明确写出来仍然很重要
选一个,最多两个。把五种镜头运动硬塞进一个 5 秒的片段,只会让结果变得混乱。
围绕时长与画幅做规划
本平台上的每个模型都有一份固定的片段时长菜单,而不是一个可以随意拖动的滑块,写提示词之前先了解这份菜单很值得:
- Kling——5 秒或 10 秒
- Veo 3.1——4 秒、6 秒或 8 秒
- Sora 2——4 秒、8 秒或 12 秒
- Seedance——5 秒或 10 秒
更短的片段适合承载单一、干净利落的动作——一件产品转动、一只手伸入画面、一个手势。更长的片段可以承载一个小的连续动作(比如某人走进画面、坐下、端起杯子),但如果你按顺序描述这套动作,效果会更好,因为模型实际上是在根据你的文字规划一份迷你分镜表。
画幅比例应该匹配片段的最终用途,并且要在生成之前就定好,而不是生成后再裁切:
- 16:9——适合 YouTube、落地页和传统视频位
- 9:16——适合 TikTok、Reels 和 Shorts
- 1:1——适合信息流帖子
负面提示词:说清楚不该发生什么
本平台上的 Kling、Veo 3.1 和 Wan 都支持负面提示词——一个独立字段,专门用来填写你希望模型主动避免的内容,而不是把"没有文字、没有水印、不要模糊"这类要求硬塞进主提示词里,跟你真正想要的内容互相争夺注意力。遇到反复出现的问题时用它最合适:变形的手、多余的肢体、文字瑕疵、运动模糊,或者悄悄混入了你没要求过的风格。
图生视频与文生视频的提示词写法
如果你要用图生视频给一张现成的照片赋予动态,就不用再写主体和风格描述了——图像本身已经把这两者都定义好了。把整条提示词都花在动作本身上:"缓慢推近,杯中蒸汽升腾,镜头轻轻晃动。"重新描述照片里已经存在的内容没有帮助,反而可能和模型看到的画面产生冲突。
而对于纯粹的文生视频,你是在从零定义一切,所以上面完整的五要素结构不是不重要,而是更加重要。
像真正在意结果一样去迭代
把你的第一次生成当作草稿,而不是最终答案。一个实际有效的迭代循环:
- 写一条包含全部五要素的精简提示词,生成一次。
- 看看哪里不对——通常是镜头运动、节奏,或某个具体的视觉细节。
- 每次只增加或调整一处,而不是把整条提示词推倒重写。如果动作没问题、只是灯光偏平淡,那就只动灯光相关的措辞。
写 AI 视频提示词,更像是在做导演,而不是写一句配文。你能把一个真正的摄影师会做的事情描述得多精确,最终结果就能多接近你脑海中的画面。想看看每个模型在这些提示词上的实际表现,可以参考我们的 Kling、Veo、Sora 与 Seedance 对比评测。