VideosPrompt VideosPrompt

如何写出自然流畅的 AI 视频 Prompt:2026 公式

作者: VideosPrompt 日期: 2026-10-07 14:12:10
如何写出自然流畅的 AI 视频 Prompt:2026 公式

TL;DR(太长不看)

  • 机械的 prompt 只会产出机械的视频:关键词清单没有可调度的内容;导演任务书才给出一个可执行的镜头。
  • 2026 公式是六个有序槽位——主体 → 动作 → 环境 → 镜头 → 光线 → 风格——外加面向 Veo 3.1 等音频原生模型的声音。
  • 顺序很重要:模型对靠前的 token 权重更高,所以主体开头,镜头先于风格,先定构图再定观感。
  • 具体胜过冗长:“一条城市街道”只是一个平均值,“凌晨 2 点雨后湿滑的东京小巷,霓虹倒映在水洼里”才是一个地点。
  • 只有可观察的动词才能推动像素——“推近”“移焦”——而“优美地”“惊人地”什么也没指示。
  • 负面 prompt 因模型而异:开源管线有专门字段;多数商业网页应用需要用正面表述。
  • 包含 10 个可直接套用的模板,涵盖五种风格:电影感、产品、社媒、叙事、抽象。

为什么机械的 prompt 只会产出机械的视频

流传甚广的一种说法是 AI 视频模型偏爱“prompt 体”——像 cyberpunk city, neon, rain, cinematic, 4k, masterpiece 这样的关键词沙拉,这是早期图像模型的遗留。到了 2026 年,它成了累赘:关键词清单只说要包含哪些名词,对镜头该如何表现只字未提,于是模型用它的默认值填补每一处空白——一个静止的定场镜头、平庸的光线、架在三脚架上的摄影机。prompt 是机械的,视频也就是机械的。

解法——也是 AI 视频 prompt 自然 2026 公式的前提——是心智模型的转变:你的 prompt 不是搜索查询,而是执导。 摄影指导绝不会收到 cyberpunk city, neon, rain 这样的任务书,他们会收到场景描述:画面里有谁、他们在做什么、在哪里、怎么拍、光线在做什么。这样写,模型的行为就不像搜索引擎,而更像一个剧组。

“自然”在这里有精确含义。 一个自然的 prompt 读起来像导演任务书:完整的从句而非名词堆砌,具体的名词而非类别标签,可观察的运动而非评价性的赞美。它不是为了长而长。在我们 2026 年 10 月前跨 Seedance 2.5、Kling 3.0 和 Veo 3.1 的测试中,产出最可用首拍的 prompt,都是导演能在片场朗读出声的那种。

一个提醒:一个 prompt 不通吃所有模型。 MStudio prompting 指南把这一点立为核心规则——Kling 奖励括号内的运动注记,Veo 奖励描述性英文段落,Seedance 奖励紧凑的两行结构。下面的公式是共享骨架;填充内容因模型而异。我们的 2026 大师课覆盖了这种分歧——这是“很棒”的 prompt 换个生成器就失效的最常见原因。


2026 公式:六个槽位,按此顺序

这里每个 prompt 都遵循六个槽位,能生成音频的模型再加第七个。它们不是可以打乱的清单,而是操作顺序。

# 槽位 它回答的问题 示例片段
1 主体 画面里是谁或什么? “a stray cat with a torn left ear”
2 动作 主体做什么? “crosses wet cobblestones, shakes off rain”
3 环境 何时何地? “a rain-slicked Tokyo alley at 2am”
4 镜头 如何构图与运动? “low 35mm, slow push-in”
5 光线 光线在做什么? “neon the only source, hard wet reflections”
6 风格 观感与调性是什么? “grainy 35mm film, muted palette”
7 (+) 声音 我们听到什么?(仅音频模型) “distant train, soft rain”

为什么这个顺序有效

模型对靠前的 token 权重更高。 开头确立场景是关于什么的;其后的一切都在修饰这个画面——所以主体排在最前,在任何关于情绪或胶片型号的形容词之前。若以 cinematic, 35mm, moody lighting 开头、到第四行才点名主体,你就是在让风格领跑——在我们的测试中,跑偏的正是主体。

动作先于环境,因为运动是模型最常出错的地方。 在注意力最集中时锁定*什么在动、怎么动*,等于把最难的指令先交给模型;动作锚定时间层,环境只约束外观。

永远镜头先于风格。 镜头定义画面的*几何*——镜头、角度、运动、景深;风格定义*皮肤*。风格先行,模型会把观感焊进默认构图,然后跟你的镜头指令打架。一个镜头从句——角度、构图、一个运动——就够了;相关词汇见我们的电影感镜头运动指南。

光线居于两者之间,因为它是物理的而非装饰性的: 有动机的光源、方向、硬光或柔光——而不是一个情绪词。声音放最后,且只给能听的模型: Veo 3.1 和支持音频的 Seedance 把它当作覆盖在成片上的图层;在无声模型上删掉它(Veo 3.1 原生音频解析)。

公式一行版:

Template: [Subject] [Action] in/at [Environment]. [Camera]. [Lighting]. [Style]. [Sound — audio models only].

自然 vs. 机械:四组对照

第一组——关键词清单 vs. 导演。

Bad:  cyberpunk city, neon, rain, cinematic, epic, 4k, masterpiece
Good: A street vendor closes his stall in a rain-slicked cyberpunk market alley as holographic ads flicker overhead. Handheld medium shot, slow pan following him stacking crates. Practical neon only — pink and teal reflected in standing water. Near-future film look, slight haze. Sound: sizzling grill, rain on canvas.

变了什么:一个做事的主体、一个具体的地点、一个镜头运动而非“cinematic”、有动机的光、风格殿后、一行声音。“Epic”和“masterpiece”毫无作为;每一处替换都在起作用。

第二组——评价性赞美 vs. 可观察细节。 “amazing”这类形容词描述的是观众的反应——而不是一帧画面。

Bad:  An amazingly beautiful woman dances beautifully in a beautiful garden, high quality, stunning
Good: A woman in a flowing red dress spins through a walled rose garden at golden hour, her skirt flaring as petals lift off the path. Wide shot, locked-off camera, subject moving through the frame. Low warm sun raking from camera left, long shadows on gravel. Naturalistic film look.

变了什么:“beautiful”出现了四次却什么也没具体化;改写点出了裙子颜色、一座花园、一个时刻和几种运动——“旋转”“扬起”“飘离”——都是模型能动画化的。光和镜头拿到了具体决定。

第三组——只有风格 vs. 镜头领衔。 只给 prompt 做风格包装而不加镜头指向,产出的是一张漂亮的海报,而不是一个镜头。

Bad:  Epic drone shot style, hyperrealistic, award winning cinematography, mountain temple
Good: A stone temple crowns a mist-covered ridge at dawn as a single monk crosses the courtyard. Aerial establishing shot: the drone rises from courtyard level to reveal the valley, then holds. Soft dawn light from the right, cool mist below, warm sky above. Hyperreal documentary grade.

变了什么:只写镜头风格而不写运动,模型会自己发明一个——通常是无视庙宇的通用掠过镜头。好的 prompt 把运动写出了起点和终点(“升起……然后悬停”),时间层正是咬住这一点。

第四组——类别标签 vs. 具体主体。

Bad:  A city street at night, cars driving, realistic video
Good: A rain-slicked Tokyo alley at 2am, neon reflecting in puddles as a lone taxi idles at the far end. Slow dolly forward at hip height. Practical light only — vending machine glow, signage, tail lights. Gritty 35mm night photography, crushed shadows. Sound: idling engine, a train passing overhead.

变了什么:同一个场景从下面具体度阶梯的第 1 级跃升到第 5 级,并挂上了镜头、光、风格和声音。


具体胜过冗长

关于“好” prompt 最常见的误解是它必须长。它必须*具体*:

  • “一条城市街道”——没有地点、时间、天气或路面。模型渲染出每条街道的统计中心:干燥的柏油路、正午的光、什么也没发生。
  • “凌晨 2 点雨后湿滑的东京小巷,霓虹倒映在水洼里”——一处地理、一个时刻、一种路面、一桩光事件。每个词排除了成千上万种可能的帧,只留下一个连贯的地方。

在我们的测试中,这四个细节每次都胜过额外三句情绪文字。填充增加 token;具体度减去可能性——它收窄采样空间,而长度做不到。

具体度阶梯

把这架阶梯当作生成前的自检。多数失败的 prompt 卡在第 2 级;生产级 prompt 活在第 4 级,而第 5 级是音频原生模型拿到提示的地方。

级 你添加什么 示例片段 模型现在能解析出什么
1 具体名词 “a city street” 只有类别平均值——平庸而静止
2 + 地点与时间 “rain-slicked Tokyo alley at 2am” 色调、密度、天气、时段光
3 + 物理细节 “neon in puddles, steam from a grate, a taxi idling” 具体光事件与背景运动
4 + 镜头与光线 “low 35mm, slow dolly; practical neon only” 构图、景深、明确的光逻辑
5 + 运动与声音 “…the taxi pulls away. Sound: wet tires” 一个带时间节拍与音频的完整镜头

各级是叠加的——你只追加,从不删除。大多数人在第 3 级没做够:一到三个*物理*细节(一个表面、一个光源、一个背景人物)胜过任何形容词。如果一个词不能帮摄影助理把机器对准某样东西,它就是装饰。


视频模型能懂的动词——以及不懂的

视频模型预测画面中接下来会发生什么。动词是这次预测的指令集;评价性副词不是。

有效的动词

  • 镜头运动: pan、tilt、push in、pull back、track、orbit、rise、rack focus(摇、俯仰、推、拉、跟、环绕、升起、移焦)。
  • 主体运动: 走、旋转、躲避、伸手、倒、举起、转身、倾身。
  • 材质与环境: 滴落、泛涟漪、闪烁、阴燃、飘动、倾泻、摇曳、蒸发。

每一个都能在画面中被观察:“蜡烛闪烁”是可证伪的——光要么晃,要么不晃。“蜡烛表现得很优美”则不可证伪。

无效的动词(和形容词)

不可执行的词 为何无效 改写为
“优美地” 是判断,不是画面 点名你觉得美的东西:“长长的影子”“逆光的蒸汽”
“惊人地” 是观众反应,不是场景 删掉;补一个第 3 级物理细节
“专业地” 专业的*什么*? 一个镜头决定:“锁定三脚架、50mm、浅景深”
“高品质” 是模型的下限,不是指令 分辨率是设置项,不是 prompt 文本
“电影级杰作” 两个评价性名词,零指令 “2.39:1 变形宽银幕,缓慢推轨”

一个词如果能在片场朗读出来仍然成立,就保留;如果摄影助理会问“这具体是什么意思?”,就换掉。这也是我们在 AI 视频生成失败指南中最快的修法——许多“神秘”的劣质生成,不过是一个评价性词汇毫无作为,而镜头本身无人描述。


反向思维:何时使用负面 prompt

负面 prompt 是一个填写*不应出现*内容的字段——“多余手指、水印、文字、模糊”。它很钝——擅长压制瑕疵,不擅长塑造场景。三条规则:

  1. 负面用于缺陷,不用于导向。 “无水印、无文字、无多余肢体”——可以。场景导向属于正面 prompt。
  2. 优先正面表述。 “一条空巷”胜过“没有人”——前者点名目标帧;后者点名的是一帧模型必须先凭空想象的画面。
  3. 机制要与模型匹配。 不是每个界面都暴露负面字段。

各模型的负面 prompt 支持情况

支持指*专用*的负面 prompt 参数,观察于 2026 年 10 月。厂商界面变化很快——在围绕某个字段搭建流程前,请对照你当前的文档核实。

模型 / 管线 专用负面 prompt? 如何表达排除项
开源管线——Wan、Hunyuan Video、LTX-Video(如 ComfyUI) 有——独立负面输入 缺陷名词:“blurry, extra limbs, watermark, text”
Seedance 2.5(BytePlus / 豆包) 标准流程中无专用字段 正面表述;保持六槽位顺序
Kling(网页应用) 无有据可查的独立字段 “empty street”,而非“no crowd”
Runway(网页应用) 无独立字段 全部导向写进正面 prompt
Veo 3.1(Gemini API / Flow) 无负面参数 排除项只以场景描述表达
第三方前端 不一——有些会给任意后端加一个字段 看到就只填缺陷;规则 1 依然适用

如果你的模型有这个字段,在里面放一份简短的缺陷清单,把 100% 的创意导向放进正面 prompt。如果没有,也没什么损失——第 3 级以上的正面表述留给幻觉的空间很小。导向与负面冲突时会发生什么,见本批姊妹篇:AI 视频生成失败与 prompt 修复。


10 个模板,5 种风格

每个模板都遵循 主体 → 动作 → 环境 → 镜头 → 光线 → 风格(+ 声音)。填入方括号,保持顺序,替换词汇——无声模型上删掉 Sound: 行。

电影感

Template 1 (Cinematic — establishing): A lone fisherman mends a torn net on a fog-bound pier at first light, gulls circling above. Wide shot, slow push-in from the pier's end, 40mm. Diffuse grey dawn light, fog rolling low over the water. Muted 35mm film look. Sound: water lapping, gulls, rope creaking.

Template 2 (Cinematic — close-up): A woman reads a handwritten letter at a kitchen table, her expression shifting from curiosity to recognition as her eyes stop on one line. Close-up, 85mm, slow rack from letter to eyes. Soft window light from camera left. Naturalistic indie-drama grade. Sound: page turning, a clock ticking.

产品

Template 3 (Product — hero reveal): A frosted-glass serum bottle stands on wet dark stone as fine mist settles around it, droplets running down the glass. Slow orbit, macro 60mm, shallow depth of field. Hard key from upper right, cool fill from the left. Clean commercial still-life look. Sound: a soft aerosol hiss.

Template 4 (Product — in use): Fresh espresso pours into a ceramic cup on a walnut counter, crema swirling as the stream thins and stops. Locked-off top-down, 50mm. Warm morning window light from the upper left, steam catching backlight. Appetizing food-film grade. Sound: the pour, the pump winding down.

社媒

Template 5 (Social — vertical hook, 9:16): Frame 1: a chef's hands crack a steaming dumpling open in extreme close-up, cheese pulling in a long strand, steam bursting toward the lens. Vertical 9:16, macro push-in, hard cut at 2 seconds to the chef grinning behind the pass. Ring light plus warm kitchen practicals. Saturated short-form grade, slight speed ramp. Sound: a crisp crackle, one music beat on the cut.

Template 6 (Social — before/after transition): A plain black sneaker on a grey pedestal spins once as a teal light wipe passes across the frame, revealing the same sneaker in retro colorway. Vertical 9:16, locked-off medium shot, the swap landing mid-rotation. Studio softbox key plus the moving teal wipe. Crisp catalog-meets-social look, no text. Sound: a synth whoosh synced to the wipe.

叙事

Template 7 (Narrative — micro-scene): A delivery driver leaves a package on a rain-damp porch, glances at the doorbell, then jogs to his van as the motion light dies. Medium shot tracking him to the van, then holding on the porch, 35mm. Cold overhead motion light as key, warm living-room glow through sidelights. Grounded realism, slight handheld. Sound: rain, a van door slamming.

Template 8 (Narrative — cause and effect): A boy folds a paper boat at a flooded curb, sets it adrift in the gutter current, and stands as it rounds the corner and disappears. Low wide shot at eye level, tilt down to the launch, then back up to his face, 28mm. Overcast afternoon light, silver water, one red leaf drifting past. Tender live-action look. Sound: trickling water.

抽象

Template 9 (Abstract — brand reveal): Fine gold particles drift in from the edges of a black void, converge into a rising column, then burst outward leaving a clean center. Straight-on shot, slow push-in, no cuts. Hard rim light on the particles, true black elsewhere, strong motion trails. Minimal motion graphics, no text. Sound: a low sub-bass swell, granular shimmer on the burst.

Template 10 (Abstract — loopable texture): Ink blooms unfurl through clear water in slow motion, tendrils folding and thinning as a second color cloud enters from the lower left and merges. Macro top-down, locked off, 100mm, frame edges left undisturbed for seamless looping. Even backlight, high key, clean white ground. Saturated pigment color. Sound: a deep underwater rumble, near-silence.

三点说明。替换主体与动作,保持第 4–6 槽位完整,一个模板就能服务新产品或新故事。模板 1 和 7 的压缩语域适合 Seedance——见我们的 Seedance 2.5 prompt 指南。当一次生成回来不对时,先诊断失败的槽位再重写;姊妹篇的失败分类学会告诉你,是动作、镜头还是风格在跟画面打架。


FAQ

1. 2026 年一个 AI 视频 prompt 应该多长? 足够把六个槽位各填一遍——单个镜头通常 40 到 90 个词,音频模型外加一行声音。太短则默认值接管;太长则 prompt 自相矛盾(两个镜头运动、两个光源),被任意裁决。非剪不可时,先剪形容词。

2. 词的顺序真的重要,还是只是传说? 顺序重要。模型对靠前的 token 权重更高,所以主体与动作领衔,镜头语言先于风格——先定构图,再定观感。在我们的测试中,只把一个 prompt 重排成六槽位顺序而不动内容,常常就能止住主体在镜头中途跑偏。

3. prompt 该写成完整句子还是关键词清单? 完整句子,至少是完整从句。关键词清单是给上下文窗口很小的早期模型准备的权宜之计;2026 年的模型读散文比读名词堆更好。句子还强迫出时间关系(“当他把木箱堆起来时”),关键词表达不了——而这正是视频生成最需要的。见上面四组对照。

4. 我的模型没有负面 prompt 字段,我吃亏了吗? 几乎不吃亏。点名你想要的那一帧(“一条空巷”),而不是罗列要排除的东西;把“水印”这类缺陷词留在主 prompt 之外——点名缺陷可能把它召唤出来。缺陷用负面,导向用正面。

5. 一个 prompt 能在 Seedance、Kling 和 Veo 之间复用吗? 骨架可以,措辞不行。这就是 MStudio 指南里的“一个 prompt 不通吃”规则:Kling 奖励括号运动提示,Veo 奖励 flowing 段落,Seedance 奖励压缩的两行结构。保持六个槽位及其顺序不变;按模型调整填充——句子长短、运动注记放哪、语域。cooly.ai 的 2026 实用指南和 BytePlus 新手指南得出同一结论:结构可迁移,措辞不可。


结语

自然的 AI 视频 prompt 不靠天赋或运气——它靠结构。把主体放在最前,让它行动,把它放在具体的地方,决定怎么拍,定义光线,然后选择风格;模型能听就加上声音。这就是 2026 公式——从一个 4K 定场镜头到一个九秒的竖屏钩子。

纪律很简单:要具体而非冗长,要可观察而非评价,要正面而非负面。“一条城市街道”是你问模型的问题;“凌晨 2 点雨后湿滑的东京小巷”是你给它的答案。机械的 prompt 是问题。去执导镜头吧。

深入2026 最佳 AI 视频 prompt 大师课,在电影感镜头运动指南里掌握镜头槽位,用 AI 视频生成失败与 prompt 修复逐槽位诊断失败。面向具体模型的填充,见我们的 Seedance 2.5 prompt 指南和 Veo 3.1 原生音频解析。


由 videosprompt.org 编辑团队审校 · 2026 年 10 月

分享文章

相关文章

推荐阅读

开始你的下一步

探索更多可能,发现适合你的解决方案。