2K 视频模型提示词模板:面向所有主流 AI 视频模型的通用框架
TL;DR
- “2K 视频模型提示词模板”是一种与模型无关的提示词层,只需编写一次即可在 Seedance 2.5、Kling 3.0、Veo 3.1 和 Wan 3.0 之间复用——同样的六大核心要素适用于所有主流视频模型。
- 通用骨架涵盖主体、动作、环境、镜头、光影和风格(按此排列),它们共同决定了约 80% 的输出质量。
- 各厂商在骨架之上叠加各自的”覆盖层”:Seedance 2.5 加入音频线索与
@标签,Kling 3.0 加入氛围描述符与多镜头结构,Veo 3.1 加入镜头规格与原生音频层,Wan 3.0 加入风格关键词与剪辑模式标志。 - 本文提供的十个即用模板覆盖了最常见的制作场景,从人像镜头、产品展示到多镜头序列和基于参考图的生成。
- 模板只是一个起点——它们能加速迭代,但最高质量的提示词仍需针对边缘场景、抽象概念和品牌特有调性进行手动微调。
为什么通用 2K 视频提示词框架至关重要
如果你在 2026 年哪怕只交付过一份生成式视频简报,你一定体会过这种摩擦:你为 Kling 精心编写了一段提示词,输出效果很好;把同样的提示词粘贴到 Veo 3.1,模型却无视你一半的暗示,臆造出另一个镜头,并拒绝执行你指定的镜头运动。你不得不花四十分钟用 Veo 的词汇体系从头重写提示词。当你还要为 Seedance 2.5 和 Wan 3.0 分别改写时,你就有了四份各不相同的提示词文档,而没有一个可以信赖的源头。
这种工作流的困境,而通用框架正是要解决它。其前提清晰明了:所有主流视频模型之下都存在一个共享的语义层——一套所有模型都理解的概念;而在这个语义层之上,每个厂商都添加了一层较小的、模型特有的覆盖层。如果你同时理解这两者,你写出的提示词就能跨模型移植。
根据 MStudio 2026 年关于 AI 视频模型提示词编写的指南,整个行业已经收敛于一套共同的提示词要素集合——主体、动作、环境、镜头、光影和风格——这些要素在各个模型家族中始终产出最强效果。BytePlus 的入门指南同样将同样的六大要素作为任何高质量视频提示词的基础。Cooly.ai 的 2026 年实战指南则将它们定义为”每个模型都可以直接调用的六个控制杆”。本文的框架将这一共识正式化,使其可以直接融入生产工作流。
我们刻意使用”2K 视频模型提示词模板”这一术语。这里的”2K”并非分辨率设置——而是”模型对若干”(cross-model)的速记:提示词的编写抽象到能够经受模型切换的程度。目标是编写一份模板,只需一次编写,保存在共享网盘上,在不同厂商间复用时只需替换一小段覆盖层,而非全部重写。
本文将为你呈现这套框架。
通用六要素骨架
每一个高质量的 AI 视频提示词——无论出自哪家厂商——都包含六大要素。它们不是可选的。根据我们对全部四大主流模型的测试经验,缺少其中任何一项都会显著降低输出质量。要素的顺序不如完整性重要。
| 要素 | 它所指定的内容 | 缺失时的常见问题 |
|---|---|---|
| 主体 | 画面中的主要人物、物体或角色 | 模型随意生成主体;多镜头间出现身份漂移 |
| 动作 | 主体正在做的事情——以动词驱动,有时间边界 | 输出静止、无运动、姿态通用 |
| 环境 | 场景设定——室内、室外、地点类型、时段 | 主体漂浮在虚空中或通用影棚背景中 |
| 镜头 | 景别、焦距、镜头运动、构图 | 无论意图如何,默认都是”中景,缓慢推进” |
| 光影 | 光源、方向、光质、色温 | 平淡、中性、缺乏电影感的光照 |
| 风格 | 视觉处理——胶片型号、类型、美学方向、色彩调色 | 输出偏向模型的训练默认风格 |
这六大要素并非凭空发明。它们是每家厂商文档推荐内容、从业者社区使用惯例以及底层扩散/Transformer 架构实际条件化对象的交集。MStudio 通用提示词指南将同样的六大要素视为规范分解。Cooly.ai 2026 指南以相同顺序列出它们。BytePlus 入门指南使用相同的标签。
如何编写每个要素
主体。 要具体。”一位女性”很弱。”一位 30 岁的东亚女性,黑色齐肩短发,身穿炭灰色羊毛大衣”则很强。多主体场景中,要逐一指定:”一位穿红色夹克的男士和一位穿深蓝色派克大衣的女士,相距三英尺站立。”
动作。 使用动词。必要时指定时间。”她走路”过于笼统。”她向前走三步,停顿,然后将头转向镜头”才是明确的指令。避免复合动作——一条提示词只写一个主要动作。
环境。 分层设定场景:地点类型(”都市屋顶”)、时段(”黄金时段,日落前一刻钟”)、天气(”轻微阴天”),必要时加入时代线索(”1970 年代粗野主义建筑”)。
镜头。 指定景别(”中近景”)、焦距(”等效 50mm”)、镜头运动(”整段镜头缓慢推近镜头”)以及构图规则(”三分构图,主体位于左侧三分线上”)。
光影。 标明光源(”从镜头左侧打出的单一主光”)、光质(”柔和、漫射”)以及色温(”暖色钨丝灯,3200K”)。
风格。 锚定视觉世界。选择一个参考标杆:”35mm 胶片拍摄,Kodak Vision3 500T 彩色胶片”、”王家卫长镜头风格”、”超写实数字电影摄影”。
写出这六大要素后的输出就是一份骨架提示词——一串几乎像分镜表一样的描述符。这份骨架可以跨模型移植。厂商覆盖层才是你在此基础上添加的内容。
厂商专属覆盖层
通用骨架是基线。每个模型都额外加入了一小套独特的、经过专门调校的线索——模型对它们有专门的响应。我们称之为厂商覆盖层。它们是提示词中不能跨模型移植的那一层。换模型时你换覆盖层——但骨架保持不变。
下表汇总了四大主流模型的覆盖层。我们将在后文逐一详述。
| 要素 | Seedance 2.5 | Kling 3.0 | Veo 3.1 | Wan 3.0 |
|---|---|---|---|---|
| 音频 | 显式声音线索、@audio 标签、引号中的对白 |
可选环境氛围层,无原生对白 | 原生音频层、口型同步、音效设计线索 | 可选音乐层、音效描述符 |
| 多镜头结构 | 通过 @shot1 → @shot2 标签实现的因果链 |
内置多镜头模式,支持场景切分 | 通过提示词长度与结构隐式实现 | 剪辑模式标志 [cut]、[transition] |
| 因果逻辑 | 强因果链支持——”A 导致 B 导致 C” | 有限;更擅长单场景因果 | 中等;通过 CoT 式提示词进行推理 | 有限;配合剪辑模式标志效果更佳 |
| 风格关键词 | 有限;依赖六要素骨架 | 氛围描述符(”忧郁”、”空灵”) | 镜头规格(”变形”、”老式 Cooke”) | 强风格关键词(”电影感”、”黑色”) |
| 主体标记 | @subject 用于身份保持 |
@character 用于跨镜头一致性 |
有限;依赖提示词细节 | @ref 用于参考图像的锚定 |
Seedance 2.5
Seedance 2.5 是主流厂商中音频最优先的模型。该模型将音频视为提示词的一等公民。如果你想要某种声音,就明确命名:”雨滴落在混凝土上的声音”、”硬木地板上的脚步声”、”持续的单个大提琴音符”。对白用引号包裹:她说:"别走。" 模型还通过 @shot1 → @shot2 → @shot3 语法支持因果链,以实现多镜头连续性。完整语法请参考我们的 Seedance 2.5 提示词指南。
Kling 3.0
Kling 3.0 最具电影思维。当 Seedance 侧重音频时,Kling 侧重氛围。模型对氛围描述符有强烈响应——”忧郁”、”空灵”、”幽闭”、”通体发光”——并以此来影响光照、色彩调色和节奏决策。Kling 还拥有最强大的内置多镜头模式:你可以在一条提示词中写明场景切分(”场景 1:…… / 场景 2:…… / 场景 3:……”),Kling 会将其渲染为连贯的序列。关于跨镜头的角色一致性,请参阅我们的 Kling 3.0 角色一致性文章。
Veo 3.1
Veo 3.1 在电影语言理解方面最为深厚。其厂商覆盖层包含显式镜头规格(”35mm 变形镜头”、”老式 Cooke S4/i”),而其他厂商无法稳定解读这些。Veo 还拥有与 Seedance 2.5 类似的原生音频层,但口型同步更紧、音效设计词汇更丰富。Veo 真正的差异化在于镜头运动:它对”甩镜”、”眩晕变焦推拉”和”Snorricam”等复杂运动的解读比同行更准确。关于原生 4K 工作流,请参阅 Veo 3.1 原生音频 4K。
Wan 3.0
Wan 3.0 最具剪辑意识。其厂商覆盖层包含剪辑模式标志——[cut]、[transition:dissolve]、[match_cut]——模型将其解读为导演指令。Wan 还拥有最强的风格关键词词汇表:”黑色电影”、”粉彩”、”高调”、”低调”、”霓虹黑色”能够可靠地控制色彩调色。Wan 3.0 通过 @ref 支持参考图像锚定,以实现角色和产品的连续性。关于商业广告工作流,请参阅 Wan 3.0 商业广告。
即用模板:10 个开箱即用的提示词骨架
以下每个模板都是通用六要素骨架加上相应的厂商覆盖层。将它们作为起点——替换你的主体、动作、环境和风格。除非另有说明,所有模板均假设输出为 2K 分辨率。
模板 1:人像镜头(仅通用骨架)
A close-up portrait of a [SUBJECT: 30-year-old woman with short auburn hair and freckles], [ACTION: turning slowly to face the camera with a subtle smile], in [ENVIRONMENT: a sunlit artist studio with whitewashed brick walls], [CAMERA: 85mm lens, eye-level, slight push-in over 4 seconds], [LIGHTING: soft window light from camera-right, warm 3500K], [STYLE: shot on digital cinema camera, shallow depth of field, Kodak Vision3 500T color grade].
### 模板 2:风光镜头(通用骨架)
A wide establishing shot of [SUBJECT: a snow-capped mountain range reflected in still water], [ACTION: morning mist drifting slowly across the valley], [ENVIRONMENT: high alpine lake at dawn, twenty minutes before sunrise], [CAMERA: 24mm wide angle, locked-off static shot], [LIGHTING: pre-dawn blue hour with the first warm light kissing the peaks], [STYLE: National Geographic cover aesthetic, deep focus, saturated but natural color].
模板 3:动作镜头(通用骨架)
[ACTION: A parkour athlete vaults over a concrete barrier, lands in a roll, and springs up into a run], [SUBJECT: a young man in a black tracksuit and red sneakers], [ENVIRONMENT: an empty urban plaza at night, wet pavement], [CAMERA: handheld, 35mm lens, tracking shot matching the subject’s speed, slight shake for realism], [LIGHTING: sodium-vapor streetlights casting orange pools, deep shadows], [STYLE: documentary realism, gritty, high frame rate for slow-motion review].
### 模板 4:产品镜头(通用骨架)
A hero product shot of [SUBJECT: a sleek black wireless earbud case resting on a marble pedestal], [ACTION: the case opens slowly, revealing the earbuds catching a highlight], [ENVIRONMENT: a minimalist studio with a deep navy gradient backdrop], [CAMERA: macro lens, slow orbit from left to right, 10 degrees of arc], [LIGHTING: three-point lighting with a strong key, soft fill, and rim light to define the chrome edge], [STYLE: luxury product commercial aesthetic, pristine focus, cool color grade].
模板 5:抽象运动(通用骨架)
[ACTION: Fluid ink disperses in slow motion through a clear liquid], [ENVIRONMENT: a black studio tank with controlled temperature], [CAMERA: macro lens, locked-off, with a slow rack-focus from the dispersion front to the trailing edge], [LIGHTING: a single backlight creating silhouettes and refracted color, deep blacks], [STYLE: high-speed photography aesthetic, hyperreal, 1000fps look].
### 模板 6:对白场景(Seedance 2.5 覆盖层)
[ACTION: A man and a woman sit across from each other at a small café table, having a tense conversation], [SUBJECT: man in a dark grey suit, woman in a burgundy blouse], [ENVIRONMENT: a rainy evening, Parisian side-street café, blurred bokeh of streetlights through the window], [CAMERA: shot/reverse-shot alternation, 50mm lens, eye-level], [LIGHTING: warm interior practicals from above, cool blue-grey rain light from the window], [STYLE: French film, desaturated, intimate framing]. Audio: ambient café murmur, soft rain on glass. Man says, "You knew, didn't you?" Woman says, "I suspected."
模板 7:竖屏社交片段(通用骨架,9:16)
[ACTION: A young woman applies lipstick while looking into a compact mirror, then smiles at the camera], [SUBJECT: a 20-something woman with long dark hair, wearing a cream cashmere sweater], [ENVIRONMENT: a softly lit bedroom, gold-trimmed mirror, peonies on the vanity], [CAMERA: vertical 9:16, medium close-up, slight handheld float], [LIGHTING: ring light from front, warm ambient lamps from behind], [STYLE: TikTok beauty aesthetic, soft glow, saturated peach palette].
### 模板 8:多镜头序列(Kling 3.0 覆盖层)
Scene 1: [ACTION: a child runs through a sunlit meadow, camera follows from behind], [ENVIRONMENT: tall golden grass, late afternoon], [CAMERA: 35mm, tracking shot, low angle to emphasize the grass height]. Scene 2: [ACTION: the child stops and turns to look back over their shoulder toward the camera], [CAMERA: matching cut, slight push-in]. Scene 3: [ACTION: the child's face breaks into a wide smile, eyes squinting in the sun], [CAMERA: 85mm close-up, locked-off]. Atmosphere: nostalgic, summer afternoon warmth, soft pastel color grade.
模板 9:含音频场景(Seedance 2.5 / Veo 3.1 覆盖层)
[ACTION: An old wooden floor creaks as a single pair of feet walks down a long hallway], [SUBJECT: a person in worn leather boots and a long coat, viewed from the ankles down], [ENVIRONMENT: an abandoned Victorian hallway, peeling wallpaper, dim], [CAMERA: low angle, 35mm, slow dolly backward matching the footsteps], [LIGHTING: a single flickering wall sconce at the far end casting long shadows toward the lens], [AUDIO]: sustained low drone, the creak of each footstep, distant wind, a single distant clock tick].
### 模板 10:含参考图场景(Wan 3.0 覆盖层)
[ACTION: The subject from @ref performs a slow head turn, blinking once], [SUBJECT: @ref — the character from the reference image], [ENVIRONMENT: the same neutral grey studio backdrop as the reference], [CAMERA: 85mm close-up, locked-off, eye-level], [LIGHTING: a single soft key light from camera-left at 45 degrees, matching the reference], [STYLE: matching the reference image's color and texture]. [edit_mode: ref2v, preserve_identity: high, motion: subtle].
关于参考图到视频工作流的更深入探讨,请参阅 Ref2V Seedance 参考图到视频。
如何在不同厂商之间迁移模板
我们以同一个创意简报为例,分别为四大主流模型改写。简报内容:一位孤独的宇航员在日落时分走过一片红色火星沙漠,天空中地球如同一颗微小的蓝色大理石。
通用骨架
[ACTION: A lone astronaut walks across a vast red desert, leaving footprints in the dust], [SUBJECT: an astronaut in a white EVA suit with a gold-tinted visor], [ENVIRONMENT: a Martian plain at sunset, deep red sand stretching to the horizon], [CAMERA: wide shot, 24mm lens, slow tracking shot alongside the astronaut], [LIGHTING: low-angle golden-hour sun from camera-left, long shadows, atmospheric haze], [STYLE: photorealistic, IMAX documentary cinematography, deep saturated reds and oranges].
Seedance 2.5
[ACTION: A lone astronaut walks across a vast red Martian desert at sunset, leaving a trail of footprints in the rust-colored dust], [SUBJECT: an astronaut in a white EVA suit with a gold-tinted visor reflecting the sunset], [ENVIRONMENT: a Martian plain at sunset, ochre sand stretching to the horizon, a thin blue Earth visible low in the sky], [CAMERA: wide shot, 24mm lens, slow tracking shot alongside the astronaut], [LIGHTING: low-angle golden-hour sun from camera-left, long shadows stretching to the right, atmospheric dust haze catching the light], [STYLE: photorealistic, IMAX documentary cinematography, deep saturated reds and oranges]. Audio: the soft crunch of boots on sand, a low sustained wind, distant atmospheric rumble. @audio: ambient Mars soundscape, no music.
Kling 3.0
[ACTION: A lone astronaut walks across a vast red desert, pausing once to look up at the sky], [SUBJECT: an astronaut in a white EVA suit with a gold-tinted visor], [ENVIRONMENT: a Martian plain at sunset, deep red sand stretching to the horizon, the sun a small bright disc low in the sky], [CAMERA: wide shot, 24mm lens, slow tracking shot alongside the astronaut], [LIGHTING: low-angle golden-hour sun from camera-left, long shadows, atmospheric haze], [STYLE: photorealistic, IMAX documentary cinematography]. Scene break: at the three-second mark, the astronaut stops, looks up, and the camera tilts up to reveal Earth as a tiny blue marble in the darkening sky. Atmosphere: solitary, awe-struck, melancholic, vast.
Veo 3.1
[ACTION: A lone astronaut walks across a vast red Martian desert at sunset, leaving footprints in the dust], [SUBJECT: an astronaut in a white EVA suit with a gold-tinted visor reflecting the sunset], [ENVIRONMENT: a Martian plain at sunset, ochre sand stretching to the horizon, Earth a tiny blue marble in the upper-right of the sky], [CAMERA: wide shot, 24mm anamorphic lens, slow lateral tracking shot with a slight vertigo dolly-zoom as Earth comes into focus], [LIGHTING: low-angle golden-hour sun from camera-left, 4200K, long shadows, atmospheric dust haze with visible particulate backlit by the sun], [STYLE: photorealistic, IMAX documentary cinematography, anamorphic flare on the sun, deep saturated reds and oranges with crushed shadows]. Audio: the soft crunch of boots on sand, sustained low wind, a quiet heartbeat SFX underscoring the astronaut’s isolation.
Wan 3.0
[ACTION: A lone astronaut walks across a vast red Martian desert at sunset, leaving footprints in the dust], [SUBJECT: an astronaut in a white EVA suit with a gold-tinted visor], [ENVIRONMENT: a Martian plain at sunset, deep red sand stretching to the horizon], [CAMERA: wide shot, 24mm lens, slow tracking shot alongside the astronaut], [LIGHTING: low-angle golden-hour sun from camera-left, long shadows, atmospheric haze], [STYLE: photorealistic, IMAX documentary cinematography, deep saturated reds and oranges]. [edit_mode: single_shot, transition: none]. @ref: NASA Mars rover reference imagery for accurate terrain.
请注意骨架——前六行——是完全一致的。只有厂商覆盖层(风格块之后的样式行)有所不同。并排比较四种输出,请参阅我们的 Seedance 与 Kling 3 提示词对比。
负向提示词与质量护栏
负向提示词——你告诉模型不要做的事情——是独立于通用骨架的一层。它们分为两类。
通用负向词。 这些适用于所有模型。它们涵盖最常见的失败模式:跨镜头身份漂移(”不同的人、面部变形、身份改变”)、文字伪影(”文字、字幕、水印、标志、签名”)、人物的解剖学错误(”多余手指、畸形手部、扭曲面部、斗鸡眼”),以及图像质量退化(”模糊、低分辨率、像素化、压缩伪影、JPEG 压缩”)。
模型专属负向词。 这些是各厂商训练数据分布的特有问题。
- Seedance 2.5 倾向于过度饱和肤色,并在快速运动中生成双重曝光伪影。添加”自然肤色,无过度饱和,无双重曝光,无重影”。
- Kling 3.0 有时默认使用强烈光晕,并可能将氛围提示过度风格化为绘画般糊状效果。添加”无过度光晕,无绘画效果,照片写实纹理”。
- Veo 3.1 在历史类提示词中有时会渲染出时代错乱的细节,且已知存在屏幕文字问题。添加”无时代错乱细节,无可见文字,历史场景中无现代物件”。
- Wan 3.0 的风格关键词可能过于激进——”no noir”可能将调色拖向日光,即使你要求高对比度。要具体说明:”色彩调色:中立,非黑色电影。”
负向提示词应单独放在提示词的独立段落中,在风格块之后、音频覆盖层之前。大多数平台都有专门的负向提示词字段,请使用它。
何时不应使用模板
模板能加速迭代,但不能替代判断。以下四种情况你必须手动编写提示词——无论模板填得多好,输出都会平庸。
抽象概念。 “怀旧的感觉”、”时光流逝的概念”、”悲伤的抽象可视化”。模板假设的是具体场景。抽象概念需要诗意、唤起性的语言,这无法用六要素分解来表达。这些请手写。
品牌特有调性。 如果你在为具有明确美学的品牌制作内容——比如一家拥有自有风格的高端时装公司——提示词需要编码该品牌特有的词汇、色彩叙事和动线语言。骨架过于通用。可以将其作为骨架,但每个品牌简报的风格块都需手动编写。
多角色对话连续性。 当三个或更多角色在单个镜头中对话且服装和走位保持一致时,模板在实体解析上会捉襟见肘。你需要手动编写角色列表、服装说明和对白归属。模板会产生混乱输出。
实验性或混合技术。 任何超出模型训练分布的内容——融合两种不相关的视觉语言、要求特定历史影片的精确摄影、或融合两种运动模式——都需要手写的语言。模板的设计是保守的。
在所有其他情况下——80% 的制作场景——上面给出的模板能让你在五分钟内获得一份高质量的首版输出。
如需更广泛地了解 2026 年所有视频生成器的最佳实践,我们的 2026 年最佳 AI 视频提示词大师课是配套文章。
常见问题
“2K 视频模型提示词”到底是什么意思?
它指的是在能经受模型切换的抽象层级上编写的提示词——一种可跨多个视频生成器使用的模板。这里的”2K”是”模型对若干”(cross-model)的速记,而非分辨率设置。目标是提示词的可移植性:你只需编写一次骨架,在切换模型时更换厂商覆盖层。
如果每个模型都有自己的提示词指南,为什么还需要通用框架?
因为厂商的提示词指南只针对一家厂商编写。它们不会告诉你如何将提示词移植到竞争对手那里。通用框架为你提供一个唯一可信来源——六要素骨架——以及可移植层与厂商专属覆盖层之间的清晰分离。编写一次,多次适配。
我能对 Seedance 2.5 和 Veo 3.1 使用相同的模板吗?
骨架可以——主体、动作、环境、镜头、光影和风格。覆盖层不行。Seedance 2.5 需要显式音频线索和 @标签。Veo 3.1 需要镜头规格和原生音频层。在两者中都使用骨架,然后替换覆盖层块。
我如何知道模板何时需要手动微调?
当输出在特定要素上一贯失败时——比如镜头运动总是不对,或者光影始终无法达到你的意图——这说明模板对该场景过于通用。手动编写该要素。这种情况最常出现在品牌特有风格和抽象概念中。
有没有自动生成这些模板的工具?
一些提示词构建器 UI 可以从表单字段组装骨架。用于首版草稿还行,但它们往往过度指定,产生臃肿的提示词。我们建议手动编写骨架,仅将这些工具用作灵感来源。
提示词长度如何影响输出质量?
大多数模型都有一个注意力预算——通常是 200–400 个 token 的有效条件化量。远超过自然六要素骨架的长度会稀释对过多线索的聚焦。请保持每个元素精简。
负向提示词真的重要吗?
是的——它们是杠杆最高的提示词要素之一。一条放置得当的负向(”无文字、无水印、无畸形手部”)通常比添加另一个正向描述符更能改善输出。
哪个模型最适合初学者?
Wan 3.0 对首次使用者最宽容,因为它的风格关键词最可预测。Kling 3.0 提供最具电影感的默认效果,奖励氛围词汇。Seedance 2.5 在任何需要音效设计的简报中最强。Veo 3.1 能力最强,但也最贵,对模糊提示词的容忍度最低。
结语
上述框架是我们在四大主流视频模型上两年多生产工作的结晶。它不是编写提示词的唯一方式,也不能替代区分优秀作品与平庸之作的审美判断。然而,它确实是一个可靠的加速器——让你更快地获得高质量的首版输出,并在模型格局变化时保持提示词的可移植性。
骨架只编写一次,保存在共享网盘上。切换模型时,更换覆盖层。创意意图保持不变,样板文字随之消失。
关于各家厂商的更深入探讨,请参阅我们在全文中链接的 Seedance 与联合对比文章。
由 videosprompt.org 编辑团队审校 · 2026 年 10 月
分享文章