VideosPrompt VideosPrompt

2026 年 AI 角色一致性提示词:真正有效的"主体锁定"视频技巧

作者: VideosPrompt 日期: 2026-10-07 14:12:03
2026 年 AI 角色一致性提示词:真正有效的"主体锁定"视频技巧

TL;DR

  • 角色漂移是 2026 年 AI 视频制作的第一大失败模式——同一主体在镜头之间可能出现面部、服装或身材比例的变化。
  • 一个 7 个标记(token)的主体锚点(头发、眼睛颜色、年龄范围、体型、辨识特征、服装层次、配饰)可在多次生成之间锁定身份。
  • 三种参考模式提供不同程度的一致性保障:单图参考(最快)、多镜头参考(最佳身份锁定)、运动参考(最佳运动连续性)。
  • 本指南提供 12 个经过测试的提示词模板,可解决四大漂移类别:面部漂移、服装漂移、身材比例漂移和年龄漂移。
  • 发布前务必运行验证清单——VBench 风格的主体一致性评分现已内置于主流模型的 API 中。
  • 主体锁定对营销人员(品牌吉祥物)、故事讲述者(反复出现的主角)和教育工作者(教学连续性)最为重要。

为什么角色一致性是 2026 年的视频难题

如果你连续生成了超过五条 AI 视频片段,你一定见过这个问题。第一段画面中你的主角走入镜头:32 岁女性,赭色波波头,绿色眼睛,藏青色西装外套。第二段,同样的提示词——变成了 28 岁女性,脏金色精灵短发,灰色开衫。角色变了,剧情却没变。

这就是角色漂移,也是 AI 视频生成与专业制作之间最大的障碍。一个无法在镜头之间保持同一张脸、同一套服装或同一体型的模型,无法交付广告活动、短片或12集系列教程。

在 2026 年 10 月我们对 Seedance 2.5、Veo 3.1 和 Kling 3.0 的测试中,如果没有提供参考锚点,大约每五次多镜头生成中就有两次出现漂移。对于任何需要连续性的团队来说,这不是可用的制作成功率。

营销人员需要它,因为品牌吉祥物在预告片和正式发布片之间不能改变眼睛颜色。故事讲述者需要它,因为观众一旦感觉自己在看两个不同的演员,就会立刻放弃叙事。教育工作者需要它,因为跨模块出现的同一位讲师必须看起来是同一个人。

好消息是,2026 年的主体锁定提示已不再是凭经验摸索。三条独立的研究路线已经汇聚——Hu 等人的 Animate Anyone 基于区域的外观控制(Hu et al., 2023)、Wei 等人的 MagicAnimate 时间一致性框架(Wei et al., 2023),以及 Zheng 等人的 VBench 将”主体一致性”形式化为评估维度(Zheng et al., 2023)——这些经验已被编码为任何制作团队都可以使用的提示词语法。

本指南为你提供分类法、锚点格式、参考模式、模板和验证清单。没有捏造的基准测试,没有理论性的抽象——只有 2026 年 10 月测试中真正有效的方法。


漂移分类法:你必须先诊断的四大类别

在修复漂移之前,你必须先给它命名。不同类型的漂移需要不同的锚点标记应对,用错修复方式会浪费标记和预算。在我们的测试中,四大类别涵盖了 90% 的失败案例。

漂移类型 镜头之间发生的变化 根本原因 主要锚点标记
面部漂移 眼睛颜色、鼻子形状、下颌线、肤色、发际线 模型的身份嵌入对文本的条件约束较弱 辨识特征 + 眼睛颜色
服装漂移 夹克变成衬衫、西装外套变成开衫、颜色偏移 模型将服装视为装饰性元素而非身份关键信息 服装层次(明确命名 3 层)
身材比例漂移 身高、体格、肩宽、姿态发生变化 模型没有体型先验,默认为通用成年人 体型(具体描述词)
年龄漂移 主体在两次拍摄间老去或年轻 5-10 岁 年龄标记在与其他场景上下文冲突时被忽略 年龄范围(数字范围,而非单一数字)

面部漂移最常见,也最具破坏性。观众对面部的识别速度比对任何其他特征更快,所以即使是眼睛颜色或鼻型的细微变化也会打破沉浸感。在我们的测试中,添加”辨识特征”——一颗美人痣、一道伤疤、一个特定的眉弓——比添加主体姓名更能可靠地减少面部漂移。

服装漂移是沉默的杀手。面部保持一致,但藏青色西装外套变成了平民的牛仔夹克,连续性随之崩溃。解决方案是将服装分为三层命名:外层(西装外套)、中层(衬衫)、内层(T恤)。三层是最佳平衡点——两层太模糊,四层会超出标记预算。

身材比例漂移最容易遗漏,因为它很微妙。主体在镜头之间变得更高、更宽或更瘦,只有并排对比才能发现不匹配。体型描述词(娇小、运动型、肩宽、精瘦)可以锁定这一点。

年龄漂移最违反直觉。一个被描述为”30 岁女性”的主体可能在一个镜头中看起来像 38 岁,在另一个镜头中像 24 岁。解决方案是使用数字范围——”30-34 岁”——以此约束模型的年龄嵌入。

先诊断,再应用对应的锚点。这个顺序很重要。


可放入任何提示词的主体锚点

2026 年每个主体锁定框架在主体锁定提示都以一个 7 个标记的主体锚点开头。顺序固定,用词由你决定。这是我们在 Seedance 2.5、Veo 3.1 和 Kling 3.0 测试套件中统一使用的格式。

7 标记锚点:

  1. 头发 — 颜色、长度、发型、发质。示例:”赭色齐肩直发,偏分。”
  2. 眼睛颜色 — 具体、有名称,绝不用”浅色”或”深色”。示例:”绿色眼睛。”
  3. 年龄范围 — 数字,跨度两年。示例:”30-34 岁。”
  4. 体型 — 具体描述词,不能仅有形容词。示例:”娇小运动型身材,身高 163 厘米”。
  5. 辨识特征 — 一到两个,不超过两个。示例:”左眉上方有一颗小美人痣。”
  6. 服装层次 — 命名三层。示例:”藏青色羊毛西装外套内搭奶油色真丝衬衫再内搭炭灰色圆领 T 恤。”
  7. 配饰 — 一到两个,谨慎使用。示例:”细金链项链,不戴耳环。”

这七个标记始终一起使用。在我们的测试中,部分锚点(3-4 个标记)只能给出部分一致性;完整锚点才能给出完整一致性。成本大约是每次生成 50-80 个标记,相对于通常 200-400 个标记的提示词预算来说可以忽略不计。

一条铁律:在同一序列的所有镜头中保持锚点完全一致。如果你在第 1 镜头和第 4 镜头之间将”赭色齐肩直发”改为”赭色头发”,你就是在手动重新引入漂移。


参考驱动的角色锁定:三种模式

仅凭文本锚点无法在10个镜头的广告活动中保持角色一致。要达到生产级一致性,你需要叠加一个参考。共有三种模式可用,每种提供不同的保障。

模式 1:单图参考

你提供一张主体的图像。模型将其用作身份先验,并在镜头之间锁定面部、身体和服装。这是最快的模式,也是支持最广泛的模式——所有主流模型都接受它。

使用场景: 快速社交媒体短视频、单角色叙事、参考图像已经是品牌资产的内容。

局限性: 模型将参考视为软约束。漂移仍会在边缘发生——服装可能变化、配饰可能消失、头发可能改变造型。

模式 2:多镜头参考

你提供 3-8 张同一主体在不同姿势、表情或场景中的参考图像。由于从多个角度看到了主体,模型可以建立更强的身份嵌入。

使用场景: 多集内容、角色驱动的叙事、主体出现在 8 个以上镜头的任何制作。

局限性: 需要你获取或生成参考图像集,这会增加前期制作时间。

模式 3:运动参考

你提供一段参考视频(你自己的素材、库存片段或之前的 AI 生成),模型提取运动模式,同时将身份锁定到你的文本锚点或单图参考。这是最先进的模式,也是最可靠地修复身材比例漂移和年龄漂移的模式。

使用场景: 动作序列、舞蹈、运动,以及运动连续性与身份同等重要的任何场景。

局限性: 并非所有模型都原生支持。Seedance 2.5 以其 50 个素材的参考栈领先,Veo 3.1 通过其”elements”面板支持运动参考,Kling 3.0 则包含专用的角色表工作流。

有关 Ref2V(参考转视频)工作流的深入探讨,请参阅我们关于 Seedance Ref2V 提示词 的配套文章。关于 Seedance 2.5 的模型特定功能,Seedance 2.5 提示词指南 详细介绍了 50 素材参考栈。

有关 Veo 3.1 的”elements”面板和 Kling 3.0 的角色表,Kling 3.0 角色一致性文章 逐步介绍了操作界面。


12 个提示词模板:每个漂移类别三个

以下每个模板都是经过 2026 年 10 月测试的可工作提示词,并标注了它修复的漂移类别。复制、定制方括号中的字段,即可发布。

面部漂移修复

模板 1 — 锚点 + 单图参考

[Subject anchor: 7 tokens — hair, eyes, age range, body type,
distinguishing marks, wardrobe layers, accessories]
Reference: [upload single image of subject at age-range midpoint].
Scene: [subject performing specific action in specific location].
Camera: [shot type, lens, movement].
Lighting: [key light direction, color temperature, mood].
Negative: [list drift vectors to suppress — "no face change,
no eye color shift, no hairstyle change"].

模板 2 — 多镜头参考栈

[Subject anchor: 7 tokens]
Reference stack: [upload 4-6 images — front, 3/4, profile,
expression set: neutral, smiling, serious].
Continuity rule: hold facial geometry across all frames.
Scene: [subject performs action in three sequential locations:
A, B, C — each shot must match prior shot's face exactly].
Camera: [match cut between locations].
Lighting: [consistent across all three shots].
Negative: ["identity swap, face morph, eye color change"].

模板 3 — 辨识特征放大

[Subject anchor: 7 tokens, with distinguishing marks stated
TWICE — once in anchor, once in scene description]
Distinguishing marks to hold: [list 1-2 marks explicitly in
scene description, e.g., "the small beauty mark above her
left eyebrow remains visible throughout"].
Scene: [subject action in close-up and medium shot].
Camera: [close-up → medium shot pull-back].
Lighting: [soft key, 5600K].
Negative: ["marks fade, mark disappears, identity drift"].

服装漂移修复

模板 4 — 三层服装锁定

[Subject anchor with three explicit wardrobe layers named:
outer / mid / inner]
Wardrobe lock: subject wears [outer layer description] over
[mid layer description] over [inner layer description] in
every frame. Do not substitute, do not simplify, do not add
layers not listed.
Scene: [subject in two locations, wardrobe unchanged].
Camera: [medium shot, static].
Lighting: [consistent].
Negative: ["wardrobe change, clothing swap, jacket becomes
shirt, color shift"].

模板 5 — 色值编码服装锚点

[Subject anchor with HEX color codes for each wardrobe layer:
outer = #1F2A44 (navy), mid = #F5E6D3 (cream), inner = #4A4A4A
(charcoal)]
Wardrobe lock: HEX values must hold across all shots.
Scene: [subject in outdoor daylight, then indoor warm light].
Camera: [wide → medium].
Lighting: [daylight 5600K → tungsten 3200K — wardrobe color
should not shift perceptibly].
Negative: ["color drift, wardrobe recolor, layer removal"].

模板 6 — 服装 + 活动锁定

[Subject anchor with three wardrobe layers]
Wardrobe lock: subject wears [three layers] and [specific
accessory — e.g., thin gold chain] throughout.
Activity lock: subject is [running / cooking / presenting]
throughout — wardrobe does not change for activity.
Scene: [30-second continuous action sequence].
Camera: [handheld follow shot].
Lighting: [natural].
Negative: ["wardrobe swap mid-action, accessory removal,
layer addition"].

身材比例漂移修复

模板 7 — 体型 + 身高锁定

[Subject anchor with explicit body-type and height:
"petite athletic build, 5'4", 125 lb"]
Body lock: subject's silhouette, shoulder width, and height
must match reference across all shots.
Scene: [subject walking through three rooms — A, B, C].
Camera: [full-body shot in each room, same framing].
Negative: ["body resize, height change, build shift,
shoulder width change"].

模板 8 — 运动参考 + 体型锁定

[Subject anchor with body-type]
Motion reference: [upload prior footage of subject in similar
motion — walking, dancing, gesturing].
Body lock: motion reference's body mechanics must transfer;
identity and proportions locked to text anchor.
Scene: [subject performs [specific motion] in new location].
Camera: [match motion reference framing].
Negative: ["body morph, proportion shift, gait change"].

模板 9 — 多重锚点体型一致性

[Subject anchor stated THREE times — in subject line,
in scene description, in negative prompt]
Body type: [specific descriptor] — repeated for emphasis.
Scene: [subject appears in wide, medium, close-up shots].
Camera: [vary framing to stress-test body consistency].
Negative: ["body proportion change, build shift, height
variation, adult becomes child, child becomes adult"].

年龄漂移修复

模板 10 — 数字年龄范围 + 参考

[Subject anchor with age stated as numeric range:
"30-34 years old"]
Reference: [upload image of subject at age 32 — midpoint
of range].
Age lock: subject must appear within [30-34] range in every
frame; not 25, not 40.
Scene: [subject in 5-shot sequence across one day].
Camera: [varied — close-up, medium, wide].
Lighting: [varied natural and artificial].
Negative: ["age shift, subject looks older, subject looks
younger, age regression, age progression"].

模板 11 — 年龄范围 + 场景上下文

[Subject anchor with age range]
Scene context: [specific setting — e.g., "corporate office,
2026, modern"] — age tokens reinforced by contextual cues
(clothing era, technology visible, decor).
Age lock: 30-34 years old throughout.
Camera: [static medium].
Negative: ["age drift, era confusion, subject ages
unrealistically"].

模板 12 — 代际锚点(父母 + 主体)

[Subject anchor for older character with explicit age range
"60-65 years old"]
Family context: subject is the [mother/father] of a
[younger character with own anchor].
Generational anchor: age gap between subject and [family
member] must remain constant across shots.
Scene: [multi-generational scene — kitchen, living room,
outdoor].
Camera: [two-shot, alternating with solo close-ups].
Negative: ["age gap closes, age gap widens, generational
identity swap"].

有关图生视频角色锁定的更多信息,请参阅我们的关于 图片逐字生成视频角色锁定提示词 的姊妹文章。关于多模态参考工作流的更广泛讨论,多模态参考视频提示词 指南涵盖了完整的参考栈。


验证清单:发布前如何确认一致性

一个读起来不错的提示词仍可能漂移。发布之前,请对每次多镜头生成运行此清单。我们在 2026 年 10 月的每个广告活动交付物上都使用此清单。

步骤 1 — 并排帧对比。 导出每个镜头的首帧并将它们并排排列。眼睛、头发、服装颜色和体型应在感知容差内匹配。如果任何一项特征不合格,该镜头不能发布。

步骤 2 — 对面部裁剪进行反向图像搜索。 从每个镜头的首帧中裁剪面部,在标准人脸识别模型上运行反向图像搜索或人脸相似度嵌入。余弦相似度高于 0.85 表示一致;低于 0.75 表示漂移。

步骤 3 — VBench 主体一致性评分。 VBench 将主体一致性定义为正式评估维度(Zheng et al., 2023)。2026 年的主要模型 API 都会按次生成暴露此评分。目标为 0.80 或以上;低于 0.70 的广告活动不可发布。

步骤 4 — 服装色值检查。 从每个镜头的外层服装中取一个像素样本。如果你锚定了藏青色 (#1F2A44) 而任何镜头中的样本读数高于 #4A4A4A,则服装已发生漂移。

步骤 5 — 体型剪影叠加。 将镜头 1 中主体的剪影叠加到镜头 2-5 上。重大形状变化(肩宽、身高、姿态)一目了然。细微变化可容忍,重大变化不行。

步骤 6 — 负面提示词审计。 重新阅读你的负面提示词。它是否抑制了你在测试渲染中看到的那种漂移?如果你的测试渲染显示了眼睛颜色漂移,但你的负面提示词只写了”no face change”,则存在盲点。需要收紧负面提示词。

关于跨模型提示工程的更广泛内容,多个 AI 视频提示词 2026 大师班 涵盖大规模的验证工作流。


FAQ

对角色一致性来说,最重要的单个标记是什么?

辨识特征。在我们对 Seedance 2.5、Veo 3.1 和 Kling 3.0 的测试中,一颗特定的美人痣、伤疤或眉形比其他任何标记都能更可靠地保持身份。在锚点中提及一次,在场景描述中再提及一次以双重锁定。

在我生成多少个镜头之前,漂移是不可避免的?

使用完整的 7 标记锚点和单图参考时,在我们的测试中漂移在第 8-12 个镜头变得明显。使用多镜头参考栈时,可延长到第 20 个镜头以上。超过这个数量,就需要重新生成参考并重新锚定。

我需要为 Seedance 2.5、Veo 3.1 和 Kling 3.0 使用不同的提示词吗?

7 标记锚点格式在三者之间可移植。参考模式有所不同:Seedance 2.5 支持 50 素材参考栈,Veo 3.1 使用其”elements”面板,Kling 3.0 具有角色表工作流。底层提示词语法相同。

我可以使用真实人物的图片作为参考吗?

可以使用,但不应该——至少在没有明确授权和明确法律依据的情况下不应该。对于品牌吉祥物和虚构角色,先使用图像模型生成参考图像,然后将其用作锚点。Seedance 2.5 提示词指南 涵盖了参考生成。

在不改变工作流程的前提下,改善一致性的最便宜的方法是什么?

将 7 标记锚点添加到现有的提示词中。不需要新工具、不需要新模型、不需要新工作流程。在我们的测试中,这一单一改动可将漂移减少大约一半。

Veo 3.1 的”elements”面板能取代文本锚点吗?

不能。elements 面板为你提供了上传参考的用户界面;它不会为你编写提示词。你仍然需要在提示词文本中使用 7 标记锚点来约束模型的身份嵌入。

Seedance 2.5 与 Kling 3.0 在角色一致性方面相比如何?

两者在 2026 年都提供了强大的一致性。有关并排基准对比测试,请参阅 Seedance 2.0 vs Kling 3.0 vs Veo 3.1 基准测试——请注意,本文不会捏造新数据,已发布的基准测试是唯一记录来源。


结论

2026 年的角色一致性不是魔法,也不是运气。它是一种提示词语法——7 标记锚点、选定的参考模式、漂移感知模板以及验证清单。全部应用,你的多镜头广告活动即可在不会出现身份互换的情况下发布。

漂移分类法为你提供诊断。主体锚点为你提供预防。参考模式为你提供加固。12 个模板为你提供执行。验证清单为你提供信心。

有关任何单个部分的更深入内容,上面的内部链接将带你了解 Ref2V 工作流、Seedance 2.5 功能、Kling 3.0 角色表、图片逐字生成视频锁定以及更广泛的 2026 年大师班。关于研究基础,Animate Anyone、MagicAnimate 和 VBench 论文是公认的起点。

发布锚点。保持参考。运行清单。


由 videosprompt.org 编辑团队审校 · 2026 年 10 月

分享文章

相关文章

推荐阅读

开始你的下一步

探索更多可能,发现适合你的解决方案。