如何将参考视频转换为 AI 视频提示词:面向 Seedance、Veo、Kling 与 Wan 的工作流程
TL;DR
- 每条 AI 视频提示词都由四个可提取的层级构建而成:景别与运镜、主体与动作、环境与光照,以及风格与后期质感。
- 在免费工具(VLC、DaVinci Resolve 或 OBS)中进行逐帧标注,是在你写下提示词之前,将这四个层级作为离散观察记录下来的最快方式。
- 运镜提取是杠杆效应最高的步骤——使用一致的动词来描述推轨、环绕、摇移、推进和摇臂运动,所产出的可复现效果远远优于含糊的”慢节奏电影感”用语。
- 当你把笔记压缩为一段密实的文字,将每个运镜动词与主体、环境和调色配对时,参考视频就变成了一条可用的提示词;下文将逐步拆解一个香水广告的实际案例。
- 提示词对比——将生成的输出与参考逐镜头比较——是将一次性生成转化为可复用模板的闭环;本文末尾的 12 个模板均已预先完成对比。
- 此工作流与模型无关;同一提取流程仅需微调词汇即可同时驱动 Seedance、Veo 3.1、Kling 2.x 和 Wan 2.x。
反向工程难题
每位电影人都有过这样的时刻:你看到一段影像,想创作出捕捉其能量的作品——不是复制,而是拥有同样的运镜、同样的氛围。在 2026 年,从灵感到输出最快的路径是借助文生视频模型。难点不在模型,而在于提示词。
反向拆解视频之所以困难,是因为语言与摄影术使用不同的语法体系。运镜对摄影师和提示词解析器而言含义不同;”柔和的午后”对摄影指导和对扩散模型而言也是两码事。以下工作流不将参考视为灵感,而将其视为一份*规格说明书*——一份你可以阅读、拆解、并用所驱动模型的原生词汇重新书写的文档。
其使用场景比表面看起来更加广泛:
- 研究参考。 初级创作者可以建立一份从大师作品中解码而来的个人提示词库,通过提示词编排来学习摄影。
- 复刻趋势。 当某种视觉风格走红时,提示词层面的反向工程能让你在数小时内产出匹配的内容。
- 构建提示词库。 代理机构可以维护共享的提示词集合,使一位艺术家开发的视觉风格能够被另一位艺术家在跨活动中复用。
- 可复现性。 从提取过程推导出的提示词是可复现的。仅凭感觉写出的提示词则不能。
本文是一份可操作的工作流程。请先通读一遍,然后在运行首个参考视频的工作流时将其打开放在手边。
四项提取
视频是一层层决策的叠加。要反向拆解一段视频,需将整叠分解为四个独立层级并逐一记录。每条提示词都包含全部四层。
1. 景别与运镜。 摄影机随时间推移在*做什么*——大全景定场、中近景、特写插入、推进、拉远、环绕、推轨移动、手持漂移、静态锁定、空中下降。运镜是业余提示词写作中最常丢失的层级,也是区分真正的电影质感与生成式静帧幻灯片的关键。
2. 主体与动作。 画面中是谁或什么,他们在做什么?主体是”一位身穿定制米色大衣的女士”。动作是”穿过空旷的广场朝镜头走来”。主体*正在*做动作——使用现在时——的组合为模型提供了运动锚点。此处最常见的错误是主体细节过多(种族、年龄、体型、服装品牌)而动作细节不足。
3. 环境与光照。 我们身处何处、何时、光线在做什么?室内还是室外,城市还是自然,白天还是夜晚,强烈日光还是阴天柔光箱,黄金时刻还是蓝色时刻。光照是任何视频中最廉价的情境杠杆,但它也最常被用形容词(”美丽的”“有情绪的”)而非具体线索来描述(”来自镜头左侧 45 度的关键光,暖色 3200K,面部右侧深阴影”)。
4. 风格与后期质感。 画面在所捕捉场景之外还在做什么?调色(青橙色调、漂白旁路、低对比度粉彩)、镜头特性(变形宽银幕光斑、浅景深、老式球面柔和感)、胶片模拟、颗粒结构、帧率(24fps 电影感 vs. 30fps 广播感 vs. 60fps 超写实)。大多数”观感”决策实际上存在于这一层。
四层都要记录,即便某一层看起来显而易见。黄金时刻的静态特写仍然包含景别、主体、环境和风格——逐层写下能让你诚实地面对参考中到底有什么。
逐帧标注
标注是瓶颈,也是大多数人跳过的步骤。请不要跳过。30 秒的参考视频在 24fps 下大约包含 720 帧;试图一次性吸收如此多的视觉数据是不可能的,任何凭单一印象写出的提示词都将含糊不清。
选择一款支持逐帧拖动并能同步记录笔记的免费播放工具:
| 工具 | 最适用场景 | 标注核心功能 |
|---|---|---|
| VLC | 快速单次审阅 | 按 E 键逐帧步进,可导出帧为 PNG |
| DaVinci Resolve | 持续项目的参考库 | 每个片段内置元数据字段,入出点标记系统 |
| OBS + 媒体源 | 录制自建参考库 | 采集参考片段并添加章节标记以便后续拖动 |
针对 30 秒的参考视频,规划 15–30 分钟的多遍标注:
- 节奏。 正常速度观看整段片段。记录剪辑点、转场和整体弧线。有多少个独立镜头?能量在哪里转变?
- 逐镜头拆解。 逐镜头拖动。每个镜头用速记方式写下四层:“镜头 3——00:07 至 00:11——中近景,缓慢推进。穿米色大衣的女士,行走中。户外广场,傍晚,暖色侧光来自画面右侧。风格:浅景深,略带光晕,柔和调色。”
- 异常镜头。 回到任何感觉不同的镜头——通常是开场和结尾镜头——以同样的细致程度重新标注。
输出是一组卡片,每个镜头一张。这份清单是你的提示词唯一可信来源。后续的一切都是机械操作:将一张卡片压缩为一个句子,将输出与卡片对比,将多张卡片折叠为一条多镜头提示词。
运镜提取
运镜是杠杆效应最高的层级,因为它是最能被生成模型真正理解的部分。精准地描述摄影机,模型就会据此构图;描述含糊,模型就会猜测,且很少能匹配参考。
你使用的词汇很重要。不同的提示词解析器对不同词汇的权重不同,但以下动词在 Seedance、Veo 3.1、Kling 2.x 和 Wan 2.x 中被广泛识别。
| 动词 | 含义 | 使用场景 |
|---|---|---|
| Static / locked-off | 摄影机不移动 | 产品镜头、肖像、沉思时刻 |
| Pan | 摄影机在固定轴上水平旋转 | 揭示画面、跟踪水平运动 |
| Tilt | 摄影机在固定轴上垂直旋转 | 揭示高度、跟踪垂直运动 |
| Dolly | 摄影机物理地前后移动 | 推进营造亲密感,拉远以揭示 |
| Truck | 摄影机物理地左右移动 | 视差效果、侧向跟踪 |
| Pedestal | 摄影机物理地上下移动 | 垂直揭示、高度过渡 |
| Orbit / arc | 摄影机沿圆形路径绕主体运动 | 英雄产品镜头、戏剧性揭示 |
| Crane / boom | 摄影机沿弧线在空间中运动 | 史诗级揭示、转场、鸟瞰 |
| Handheld | 摄影师手持,可见微幅移动 | 纪录片质感、紧迫感 |
| Steadicam / gimbal | 平稳移动摄影机,地平线锁定 | 行走镜头、流畅跟踪 |
| Aerial / drone | 高位视角,常带缓慢运动 | 定场镜头、风景 |
三个参数可让描述更加精确:
- 速度。 慢、中、快,或具体时长(”两秒推进”比”缓慢推进”更有用)。
- 方向。 朝向主体、远离主体、画面左至画面右、上升、下降。
- 画面效果。 摄影机是否从宽景开始收窄为特写?保持锁定?最终的画面构图通常比移动路径更重要。
先写运镜动作,再写主体。“Slow push-in on” 然后逗号,然后是主体——这种写法更像镜头清单,也能被解析器更可靠地理解。mstudio.ai 的 AI 视频模型提示词指南中概述的通用提示词工程原则也印证了这一顺序——模型会抓住它看到的第一个具体名词短语。
从提取到提示词:实例演练
为了让工作流具体化,让我们走完一段 30 秒的参考视频——一则假设的香水广告。你已经完成了上述标注步骤,并拥有了一叠六张镜头卡片。
| 镜头 | 时间码 | 运镜 | 主体 + 动作 | 环境 + 光照 | 风格 |
|---|---|---|---|---|---|
| 1 | 00:00-00:04 | 缓慢推进,中近景 | 香水瓶在黑色玻璃底座上缓慢旋转 | 摄影室,正上方单一关键光,深阴影 | 高对比度,高光处变形宽银幕光带 |
| 2 | 00:04-00:09 | 环绕,180 度 | 同一瓶,全身入画,缓慢旋转 | 同一摄影室,背后轮廓光逐渐可见 | 同上 |
| 3 | 00:09-00:14 | 切换至极特写,缓慢向上倾斜 | 玻璃切面捕捉光线,表面有微小液滴 | 同上 | 同上,带微距虚化 |
| 4 | 00:14-00:19 | 切换至中景,静态 | 一只女性的手从画面右侧伸入,拿起瓶子 | 同上 | 同上 |
| 5 | 00:19-00:25 | 从手部向上向后摇臂升起,最终以全景落在底座及周围暗色摄影室 | 手在运动顶点将瓶子移出画面 | 同上,但全景揭示一束顶部聚光灯光柱 | 同上,略带光晕 |
| 6 | 00:25-00:30 | 静态全景,缓慢拉远 | 黑色画面中标志在底座上方淡入 | 同上 | 同上 |
要将这六张卡片转换为一条 Seedance 提示词,请不要将六个镜头全部写入一条提示词中。生成式视频模型无法可靠地串联镜头;多镜头叙事仍是整个领域的弱项。相反,选择最能捕捉参考意图的*那一个*镜头,将其写入你的提示词,然后生成多个变体。
镜头 2——环绕镜头——是正确的选择。它在一个节拍中承载了英雄主体(瓶子)、标志性运镜(环绕)、光照特征(轮廓光)和风格线索(变形宽银幕)。以下是从该卡片推导出的提示词:
Template — Perfume Bottle Orbit (Seedance 2.5 / Veo 3.1 / Kling 2.x / Wan 2.x)
Slow 180-degree orbit around a faceted glass perfume bottle on a black-glass plinth, full-body in frame, gentle continuous rotation. Single key light from above casting deep shadow below, warm rim light wrapping the bottle from behind, dark studio backdrop. Anamorphic lens character with horizontal streak on highlights, shallow depth of field, subtle bloom. Cinematic, high contrast, photoreal, 24fps, 4K.
注意提示词中有什么、没有什么。动词(”orbit”)在前。主体(”faceted glass perfume bottle”)具体且具象——不是”奢华香水”。光照通过位置和色温来描述,而非形容词。风格线索(anamorphic、shallow DOF、bloom)列在末尾,作为对前面所有内容的修饰。提示词中没有凭空编造的内容——每个词都能追溯到一张卡片。
关于跨模型的工作流对比和更多提示词解析惯例,Pixmind 的视频转提示词工作流文章是有用的平行参考;即便模型不同,技巧也是可以迁移的。
提示词对比
任何提取提示词的首次生成都不会与参考完全匹配。这不是失败——而是工作流的起点。
提示词对比将生成的输出与参考逐镜头进行比较,针对每个镜头提出三个问题:
- 什么是一样的? 识别已经匹配的元素——运镜、光照方向、调色。不要改动这些。
- 什么不同但可以接受? 识别出现偏差但仍符合意图的元素。记录它们,但不要过度修正。
- 什么是错误的? 识别需要更改的元素。通常与主体相关(形状、纹理、比例不对)或与环境相关(背景偏移)。在下一轮迭代中修正这些。
保留对比日志。使用包含*镜头、当前提示词文本、观察到的输出、修订后提示词文本*列的电子表格,可以在多轮生成中累积修正。三到四轮之后,你将得到一条能可靠复现参考能量的提示词——以及一条你足够了解、可以有目的地进行变化的提示词。
一个常见的陷阱是不断添加修饰词以迫使输出更接近参考。如果提示词未能落地,答案很少是第十个形容词。答案通常是结构性的:重写运镜动词、重新定位主体、或改变句子顺序。如有疑虑,回到你的标注卡片,问问自己你的修改针对的是哪一层。
12 个提示词模板
以下模板已为各自的风格预先完成对比。每条模板均源自一个真实参考,使用上述工作流推导而来,并经过三到五代优化。请将它们作为起点;用你自己的主题替换方括号占位符。
电影感
Template 01 — Cinematic Establishing Wide
Locked-off wide shot of [LOCATION] at [TIME OF DAY], [SUBJECT] small in frame. [KEY LIGHT DESCRIPTION], deep shadow on screen-right. Anamorphic widescreen 2.39:1, desaturated grade, gentle film grain, 24fps.
Template 02 — Cinematic Push-In Portrait
Slow dolly push-in on [SUBJECT DESCRIPTION] in [LOCATION]. Medium close-up tightening to close-up over [DURATION]. Soft key light from camera-left at 45 degrees, fill at quarter stop, gentle background separation. Shallow depth of field, naturalistic color, 24fps.
Template 03 — Cinematic Handheld Follow
Handheld follow shot trailing [SUBJECT] from behind as they walk through [LOCATION]. Visible micro-movement, motivated natural light, ambient environmental sound implied. Documentary texture, slightly lifted blacks, 24fps.
社交媒体
Template 04 — Vertical Social Reveal
Vertical 9:16 frame, slow pedestal move upward revealing [SUBJECT]. [LIGHT DESCRIPTION], saturated color, sharp foreground with creamy bokeh background. Modern, energetic, loop-friendly beat, 30fps.
Template 05 — Quick-Cut Trend Beat
Fast push-in to extreme close-up of [SUBJECT DETAIL], 1-second beat, hard cut to medium wide of full [SCENE]. Bold contrast, slightly overexposed highlights, saturated grade, social-native framing, 30fps.
Template 06 — Talking-Head Static
Locked-off medium close-up of [PRESENTER], direct eye contact with camera. Soft diffused key light, low-contrast background, minimal grade. Clean, trustworthy, broadcast-friendly, 30fps.
产品
Template 07 — Hero Product Orbit
Slow 180-degree orbit around [PRODUCT] on [SURFACE]. Full product in frame, gentle continuous rotation. Studio lighting with overhead key and rear rim, dark or gradient backdrop. Anamorphic lens character, horizontal highlight streak, shallow depth of field, photoreal, 24fps.
Template 08 — Macro Detail Insert
Extreme close-up of [PRODUCT DETAIL], slow tilt upward. Macro lens character, creamy bokeh, light catching surface texture. Studio lighting, high contrast, photoreal, 24fps.
Template 09 — Product In Context
Static medium shot of [PRODUCT] placed within [LIFESTYLE ENVIRONMENT]. Natural motivated light, props suggesting use, shallow depth of field isolating the product. Warm naturalistic grade, editorial composition, 24fps.
叙事
Template 10 — Two-Shot Conversation
Static medium two-shot of [CHARACTER A] and [CHARACTER B] in [LOCATION]. Soft motivated practical lighting, shallow depth of field, naturalistic grade. Film dialogue coverage, 24fps.
Template 11 — Emotional Reveal
Slow crane-up from close-up of [SUBJECT'S HANDS OR OBJECT] to wide reveal of [LOCATION]. Continuous single take, motivated natural light, slightly muted grade, gentle bloom on highlights. Contemplative pacing, 24fps.
Template 12 — Closing Wide Pull-Back
Slow dolly pull-back starting medium on [SUBJECT], ending wide on [ENVIRONMENT]. Single take, fading light, deep shadow building on subject. Cinematic 2.39:1, low-contrast grade, gentle grain, 24fps.
关于 Veo 3.1 专属的摄影词汇——包括变形宽银幕、焦距和音频线索惯例——Google AI Studio Veo prompt cookbook是很好的配套参考。以上多个模板使用的措辞模式与 Veo 的提示词解析器高度契合。
转换工具
此工作流刻意保持轻量化。所有步骤均无需付费软件,整套流程可在你已有的笔记本电脑上运行。
观察工具。 VLC 用于一次性拖动和帧导出。DaVinci Resolve(免费版)用于持续管理带内置元数据的参考库。OBS Studio 用于采集你自己的参考片段并添加章节标记。浏览器的开发者工具用于检视流媒体参考的播放属性(分辨率、帧率、编解码器)。
提示词构建器。 Claude 和 ChatGPT 作为起草伙伴——粘贴你的标注卡片并要求”将第 2 至第 4 个镜头压缩为一段密实提示词,如同它们是一个连续镜头”。模型不会匹配你的参考,但它会给你一段可供压缩和编辑的起始段落。
参考库。 Pinterest 画板仍然是收集静帧参考的最佳工具。Shotkit 和 Artgrid 用于策展的摄影参考。在 AI 提示词层面,Seedance 2.5 模型指南和 Veo 3.1 原生音频参考详细介绍了当前两款最强的模型。
存储。 一个文件夹结构——references/raw、references/cards、references/prompts、references/diff-logs——在你第三次运行工作流时就会回本。最常见的错误是只保留最终提示词;真正有价值的学习沉淀在卡片和对比日志中。
常见问题
我需要使用与参考视频相同的模型吗? 不需要。提取工作流与模型无关。从 Seedance 参考推导出的提示词只需微调词汇即可改写为适用于 Veo 3.1、Kling 或 Wan 的版本。四个层级是通用的。
参考视频应该多长? 学习工作流时越短越好。从 15 到 30 秒的参考开始,再尝试更长的作品。60 秒以上的多镜头参考可受益于更积极地预选一两个镜头作为建模对象。
如果我无法精确描述运镜怎么办? 关闭声音,将参考视频放慢到四分之一速度播放。运镜通常是放慢后最清晰可辨的元素。如果你仍然说不出名称,默认使用”slow dolly push-in”或”slow orbit”——两者在各模型中都被广泛识别。
如何处理混合多种风格的参考? 每次生成只选一种风格线索。同时试图兼顾变形宽银幕效果和复古胶片调色的参考往往会产出浑浊的结果。先用其中一种生成,再用另一种重新生成,从每种中挑选最佳帧作为最终结果。
此工作流对图像转视频也有用吗? 有用,只需一处调整:当将图像加提示词喂给图像转视频模型时,四项提取工作流产出提示词,参考图像提供视觉锚点。提示词承载运动、光照和风格;图像承载主体与构图。详见我们的多模态参考视频提示词指南。
一条好提示词通常需要几轮对比? 复杂参考通常三到五轮。如果你已经超过十轮仍无法收敛,问题通常是结构性的——回到标注卡片,重新提取主导层级,而非纠结于形容词的微调。
有没有可以跨风格复用的通用模板? 有——2K 视频模型提示词模板合集涵盖了适用于 Seedance、Veo、Kling 和 Wan 的规范 4K/2K 构图模式。本文中的 12 个模板用作风格专属的起点,2K 合集则作为你的模型格式参考。
结语
将参考视频反向工程为 AI 提示词并非单一技巧——而是一项四步纪律。提取四个层级。逐帧标注。将每张卡片压缩为一个以运镜动作开头的句子。将输出与参考进行对比,有意图地迭代修订。
当你将此工作流运行十次之后,你观看视频的方式将截然不同。运镜会在故事之前变得可读。调色将成为一种选择而非默认值。这才是真正的回报——更好的视觉素养,它将在每一款模型和每一个参考上复利。
如需更广泛的基础知识,2026 年最佳 AI 视频提示词大师课是正确的起点;关于特定模型的深入探讨,请参阅上文链接的 Seedance 和 Veo 指南。
由 videosprompt.org 编辑团队审校 · 2026 年 10 月
分享文章