VideosPrompt VideosPrompt

如何防止 AI 视频角色形变:阻止脸部与身体畸变的提示词技巧

作者: VideosPrompt 日期: 2026-10-07 14:12:12
如何防止 AI 视频角色形变:阻止脸部与身体畸变的提示词技巧

TL;DR

  • 角色形变——脸部融化、四肢拉长、手部畸变、年龄漂移、服装替换、肢体重复——源于时间不一致性与参考漂移:在运动、近距离与风格压力下,模型的把控力会减弱。
  • 提示词模式与模型局限一样会造成形变:相互竞争的主体、损伤解剖结构的动词(“扭曲”“变形”)、极端特写叠加快速运动,以及风格混用。
  • 防御性词汇——“解剖结构正确”“全程面部特征稳定”“自然人体比例”、数字化的肢体数量——把身份从假设变成显式约束。
  • 镜头距离会放大风险:先用中景建立主体,只有当角色在较宽画幅中证明稳定后,才可争取特写。
  • 遵循运动克制阶梯——静止与慢速最安全;快速动作叠加手部交互再加上镜头运动,是最高风险层级。
  • 当形变仍然出现时,分诊依据损伤的局部程度选择重roll、分段重生成或局部编辑。

形变分类学:为出错方式命名

你见过一张脸融化:转头途中鼻子滑过脸颊,下颌线软化成任何头骨都不可能容纳的形状——然后它又弹了回去,你拖动时间轴,怀疑会不会有人注意到。

任何人都会注意到。角色形变是 AI 视频中仅次于跨镜头不一致的第二大失败模式——它发生在*单个*片段内部,毁掉完美的镜头。

每种失败模式对应不同的防御性token——先命名,再修复:

形变 表现 典型触发
脸部融化 五官在镜头中途涂抹或滑移 转头、推近、风格混用
四肢拉长 手臂/腿部像橡胶一样拉伸,关节过度弯折 快速动作、扭曲类动词
手部畸变 手指多余、融合或缺失 手部交互、靠近镜头的物体
年龄漂移 主体在镜头内变老或变年轻 长镜头、年龄锚定薄弱
服装替换 服装剪裁、颜色或层次变化 服装只提及一次、快速运动
肢体重复 出现第三只手臂或第三条腿 肢体交叉、旋转、画面杂乱

两种机制可以解释全部六种;两者都能在提示词层面修复。

时间不一致性。 视频模型为每个瞬间优化局部合理性,而非全局身份:没有稳定性约束时,动态姿势就可能违反解剖结构,因为模型从不会回头核对两秒前渲染的那张脸。Animate Anyone 正是用基于区域的外观控制攻击了这一问题,让整个序列以一个持久参考为条件(Hu et al., 2023)。商业模型只有在你的提示词给了它们可依附之物时,才会继承这一思路。

参考漂移。 即使有参考图,条件化在生成最难处也最弱:极端特写、遮挡、快速运动、风格冲突。随着置信度下降,模型会回退到通用先验——一张通用的脸、通用的手、通用的服装。形变就是你的参考与先验之间的过渡。

VBench 将其确立为一等评估维度——“主体一致性”如今是可测量的属性,而不是一种感觉(Zheng et al., 2023)。能提升主体一致性分数的抓手——稳定的参考、克制的运动、显式的解剖约束——正是你防止形变时要拉的那些。


提示词中的形变触发器:你做错了什么

防御性提示词从做减法开始:四种模式比任何模型缺陷都更可靠地引发形变;大多数创作者不知不觉就写了至少两种。

1. 多个相互竞争的主体

“一个女人和她的倒影”、“两个穿风衣的侦探”、“一个男人面对年轻时的自己”:两个被同等强调的主体意味着两套身份嵌入需要维护,在压力下它们会互相渗透——倒影戴上了错误的耳环;第二个侦探长着第一个侦探的脸。

冲突也可能来自自我矛盾:一个角色被两次描述成不同属性(“赤褐色头发……她把金色的头发捋到耳后”)同样是竞争主体。

修复: 每个提示词只保留一个主要主体。若必须有两人,从结构上区分(年龄、轮廓、服装色系),并标记焦点:“焦点对准前景中年长的侦探;年轻的那位在后面保持柔焦。”

2. 损伤解剖结构的运动动词

“扭曲”、“变形”、“不自然地扭转”、“morph”、“扭动”、“过度伸展”都是违反解剖结构的字面指令——模型会将其视为许可。更温和的近邻也一样:“流畅如水的动作”、“身体如波浪起伏”、“像水一样舞动”都会把生成推向四肢拉长的橡胶物理。

这些动词通常出自良好的创作意图。但模型实现“扭曲”的方式是放弃骨骼——而正是骨骼让手和脸保持完整。

修复: 以关节为锚点的运动语言——“转动躯干,同时保持双臂垂于体侧”、“轻盈迈步,膝盖放松,双肩水平”。把超自然节拍留给孤立的短片段。

3. 极端镜头贴近叠加快速运动

“她的面部特写,镜头快速绕她甩动”叠加了两个放大器:特写让画面大部分落在脸上,任何身份抖动都会变得可见,而快速运动恰好在这一刻降低条件化置信度。手的版本更糟——“极端特写:双手快速组装手表”把贴近、精细运动细节和速度结合在一起——手部最容易失败的三件事同时发生。

修复: 遵循下文的镜头距离规则。贴近是争取来的,不是宣布的。

4. 风格混用

“一部吉卜力工作室风格拍摄的写实纪录片”给了模型两套互不兼容的解剖学:写实先验与风格化先验相互竞争,输出在镜头中途在两者之间漂移——眼睛一时放大,比例随之软化。混用还会削弱你的防御性词汇,因为“解剖结构正确”对不同先验意味着不同的东西。

修复: 每个提示词只有一种主导风格。如果必须融合,把风格分配给不同图层(写实主体、风格化背景),而不要混在主体上。

这些类别与 mstudio 提示词指南中列出的常见失败模式一致(mstudio)。


防御性提示词词汇:锁定解剖结构的 token

原则:永远不要让解剖结构保持隐含。“一个女人喝咖啡”没有给模型任何可防守的东西;“一个解剖结构正确、全程面部特征稳定的女人喝咖啡”则有。

核心防御短语(跨模型通用):

  • “解剖结构正确” ——主约束。直接放在主体名词之前,使其绑定身体而非场景。
  • “全程面部特征稳定” ——对抗脸部融化最强的短语:“全程”把约束延伸到时间维度,而不只是第一帧。
  • “自然人体比例” ——防范四肢拉长与躯干拉伸;搭配身高token(“5’7”)。
  • “肢体一致——两条手臂,两条腿,十根手指” ——数字化冗余。听起来冗余;它是只要手出现时对抗肢体重复与畸变最廉价的保险。
  • “每一帧都是同一张脸” ——面向特写的帧级重述,因为单独的“全程”在此容易被降权。
  • “服装全程不变” ——在会重roll服装的快速运动中锁定衣物。

负面提示词伴随项(在支持的平台上):“no face morphing, no extra fingers, no warped limbs, no age change, no costume change。”每条负面项要对应你实际观察到的形变——具体胜过笼统。

放置规则与用词同样重要:

  1. 解剖约束放在第一句,绑定在主体上。
  2. 时间约束(“全程”、“每一帧”)放在提示词结尾——尾部token在生成时会被重新读取。
  3. 长提示词中,每个主要动作节拍重复一次主体锚。重复很廉价;漂移不是。

各模型的等效机制

2026 年的每个模型都提供了超越纯文本的机制;你的防御性词汇可以接入其中:

模型 机制 搭配方式
Seedance @tag 主体引用 ”@mia — anatomically correct, stable facial features throughout”
Veo “Elements” 面板引用 “the woman from [element] keeps stable facial features throughout”
Kling 角色表 / 人脸参考 把 7-token 锚存入角色表;动作镜头重复 “consistent limbs”
Wan 首尾帧条件化(I2V) 固定帧框住所解剖结构;提示词中仍要加 “anatomically correct”

机制各异;语法不变。对于 I2V 路径,图生视频角色锁定指南展示了固定帧如何与文本约束交互。


镜头距离规则:特写放大漂移

画幅不是在提示词之后决定的——在生成中,它是*在*提示词里做出的稳定性决定。

规则 1 ——永远先用中景。 任何新角色或新镜头都以中景(腰部以上)或全景开场。脸只占画面的一小部分,身份抖动低于像素级,模型先获得轻松的热身帧。

规则 2 ——循序渐进地争取特写。 沿着节拍或分镜头从中景 → 特写 → 极端特写推进,绝不要从冷启动一镜推到底。在中景距离渲染干净的主体,是模型已经承诺过的主体;而*以*特写开场的片段没有这种承诺。

规则 3 ——极端特写是受限资产。 只在同时满足以下条件时才保留眼睛或嘴唇特写:(a) 主体在同一片段早先已在较宽画幅中建立;(b) 推进动作缓慢;© 没有手部交互。三条必须同时成立。

规则 4 ——绝不把贴近与速度结合。 甩镜头或快速推轨保持中景或全景;极端特写则让镜头锁定或缓慢爬行。两者永不同框一个节拍。

规则 5 ——手遵循同一阶梯。 “手部特写”换任何名字都是极端特写。先在中景距离引入手(“搅动一个杯子,腰部以上”),一次正确渲染后再切近。


运动克制阶梯:从最安全到最危险

运动强度是第二个放大器:用这条阶梯决定一次生成可以尝试什么。

层级 运动强度 示例 风险 指引
1 静止 / 微动作 坐着、呼吸、视线转移、缓慢眨眼 极低 即使极端特写也安全
2 慢速单肢 转头、举起杯子、指向、风吹头发 低 配慢速镜头的特写安全
3 中等全身 走向镜头、坐下、说话时打手势 中 中景;手可见但不细化
4 快速动作 奔跑、旋转、跳跃、快速甩头 高 中全景画幅;防御token必备
5 快速 + 手部交互 + 镜头运动 冲刺中接球;特写下的快速组装 极高 拆分为多个镜头或分段重生成

三条工作原则:

一次生成只承担一种风险。 4 级运动*或*极端特写*或*重度手部交互——绝不同时两个。“极端特写中的快速舞蹈”是贴着 4 级标签的 5 级提示词。

把安全部分前置。 结构上让风险片段前半段主体动作简单,然后再行动——早期稳定帧在难点到来之前锚定身份。

限制是一种特性。 Haiper 的珠宝视频工作流使用克制的运动预设——缓慢旋转、最少触碰——因为脆弱主体会随运动增强而更快失败(Haiper)。专业人士在主体脆弱之处都会约束运动——而人脸是最脆弱的主体。


12 个提示词模板,按所防御的形变标注

替换方括号中的字段;防御性子句保持原样。

模板 1 ——脸部融化(肖像,缓慢转头)

Template 1 — face melt defense
Medium close-up of [subject anchor: hair, eyes, age range, build, marks, wardrobe x3]. Anatomically correct, stable facial features throughout, identical face in every frame. She slowly turns her head to center, shoulders still. One photoreal style, camera locked. No face morphing.

模板 2 ——手部畸变(手进入画面)

Template 2 — hand corruption defense
Medium waist-up shot: [subject anchor] stirs a ceramic cup. Anatomically correct hands — two hands, ten fingers, consistent limbs throughout. Hands visible but not magnified, slow movement, camera locked. No extra or fused fingers, no warped limbs.

模板 3 ——四肢拉长(行走镜头)

Template 3 — limb elongation defense
Full shot of [subject anchor] walking toward camera on a quiet sidewalk. Natural human proportions, 5'7", anatomically correct skeleton, consistent limbs — two arms swinging naturally, two legs with correct joint bends. Camera static at waist height. No limb stretching, no body morphing.

模板 4 ——肢体重复(手势丰富的讲话)

Template 4 — duplicate limbs defense
Medium shot of [subject anchor] speaking to camera, gesturing with open hands. Exactly two arms, exactly ten fingers, consistent limbs in every frame. Gestures stay frame-center, elbows soft, camera locked, stable facial features throughout. No third arm, no hand duplication.

模板 5 ——年龄漂移(长镜头)

Template 5 — age drift defense
Medium shot of [subject anchor: numeric age range, e.g. 30-34 years old] reading at a desk. Age locked at 30-34 throughout — no aging, no de-aging. Stable facial features, unchanging skin texture, natural proportions. Minimal motion: slow blink, page turn, camera static.

模板 6 ——服装替换(运动镜头)

Template 6 — clothing swap defense
Full shot of [subject anchor] walking briskly through a station. Wardrobe unchanged throughout: [outer], [mid], [inner] layers with exact colors named — no costume change, no garment morphing, no color shift. Anatomically correct, consistent limbs, camera tracks slowly.

模板 7 ——推近中的脸部融化

Template 7 — face melt defense (camera movement)
Opens medium: [subject anchor] in a sunlit kitchen, stable facial features throughout. Slow dolly push-in easing to a stop at close-up — never extreme close-up. Subject still during the push, subtle breathing only. Identical face in every frame, one photoreal style, no morphing during camera move.

模板 8 ——竞争主体合并(双人场景)

Template 8 — subject-merge defense
FOCUS (foreground): older detective, 55-59, gray beard, charcoal coat — anatomically correct, stable facial features throughout. BACKGROUND (soft focus): younger detective, 28-32, no facial hair, navy jacket, partially turned away. Distinct ages and wardrobe, no face borrowing. Medium two-shot, camera locked. No identity blend.

模板 9 ——快速动作(4 级)

Template 9 — limb elongation defense (fast action)
Medium-wide shot of [subject anchor] sprinting across a field, leaping a low barrier. Natural human proportions, anatomically correct, consistent limbs through the full stride and jump — two arms, two legs, correct joint range. One fast action only, no hand interaction, side-tracking camera. No rubber limbs, no face melt.

模板 10 ——渐进特写(眼睛)

Template 10 — extreme close-up defense (progressive)
Opens medium: [subject anchor] looks up from a letter. Cut to close-up as she lifts her gaze — face carried stable from the medium shot, identical face in every frame. Final beat: eyes close-up, camera slow and locked. Anatomically correct, age locked at [range]. No feature drift, no morphing.

模板 11 ——手部交互(物体操作)

Template 11 — hand corruption defense (object interaction)
Medium shot: [subject anchor] at a workbench tying a cord. Anatomically correct hands — two hands, ten fingers, consistent limb count in every frame. Motion slow and joint-anchored: fingers loop and pull, wrists steady. Camera locked at chest height. No fused fingers, no hands merging with the cord.

模板 12 ——跨镜头重roll(收尾括号模式)

Template 12 — cross-shot distortion defense
[Full 7-token anchor, identical wording to shots 1-4]. Anatomically correct, stable facial features throughout, natural human proportions, consistent limbs. Wardrobe unchanged throughout: [three named layers]. Same face, same body, same clothing as prior shots — no drift, no morphing, no age change. [Tier-appropriate action]. One photoreal style.

模板 1-3 覆盖静止到慢速层级,4-6 覆盖中等层级,7-12 覆盖镜头调度、竞争主体、速度或跨镜头连续性带来额外放大器的情形。对于必须读起来像人写的提示词,2026 自然提示词公式将这些约束折叠进流畅的行文,同时不丢失防御性token。


生成后分诊:尽早发现形变,策略性重生成

预防降低发生率;分诊处理剩余部分。在第 2 秒捕捉形变很便宜;在剪辑里捕捉就不便宜了。

以四分之一速度、关掉音频拖动检查。 形变存在于运动中;正常播放速度下,眼睛会原谅一个在 0.25× 下却无可否认的六帧脸部融化。

按顺序检查五个热点:(1) 转头和镜头移动时的脸,(2) 手进入画面或抓取物体的任何时刻,(3) 光线变化处的服装过渡,(4) 最后一秒——漂移向结尾累积,(5) 每一个 4-5 级运动节拍。

做首尾帧对比。 导出第一帧与最后一帧并排查看;脸、发际线、服装颜色或轮廓的不匹配,会暴露出你尚未拖动检查过的漂移。

逐帧步进每个手部节拍。 手部畸变常常是单帧事件——一帧六指在复看时消失,因为你记得前后的帧。

选择重生成策略

情况 策略 原因
随机形变,短片段(≤5秒),其余完好 同一提示词整段重roll 分段编辑比一次全新生成更贵;方差足以清除它
形变局限于某一段(如第 4-6 秒) 分段重生成——重roll坏的窗口,或拆分镜头 保留锚定身份的干净帧
完美镜头中有 1-3 坏帧 局部编辑——从干净邻帧插值或对帧进行修补 重roll是拿整条镜头冒险去修 0.1 秒
形变在多次重roll后反复出现在同一位置 提示词手术,而非更多重roll 复发是触发器,不是方差——审计竞争主体、压力动词、贴近加速度、风格混用

一行决策逻辑:随机且短 → 重roll;局部化 → 重生成该段;几帧 → 属部编辑;反复出现 → 重写提示词。

关于更广泛的生成失败家族中的形变,参见姊妹篇 AI 视频生成失败与提示词修复。


FAQ

什么是 AI 视频角色形变?

任何在片段中途对主体物理身份或解剖结构的违反:脸部融化、四肢拉长、手部畸变、年龄漂移、服装替换和肢体重复。它区别于跨镜头漂移——形变发生在单次生成内部,由运动、特写与风格冲突下的时间不一致性和参考漂移驱动。

哪些短语最可靠地防止脸部融化?

“全程面部特征稳定”加上“每一帧都是同一张脸”——前者设定时间约束,后者以帧粒度重新锚定它。把两者与主体名词前的“解剖结构正确”,以及缓慢、锁定、中距离的镜头搭配。没有短语能补偿极端特写叠加快速运动;先修画幅。

我真的需要写“两条手臂,十根手指”吗?

需要——数字化冗余把解剖结构从假设转化为显式条件,它对 hand 畸变和肢体重复格外有效。token 成本微不足道;只要手可见或运动高于 2 级,就保留它。

形变与角色一致性有何不同?

形变是镜头内的不稳定;一致性是镜头间的稳定性。它们共享根因与防御——锚、参考和防御性词汇对两者都适用。2026 角色一致性指南讲的是在镜头之间保持身份;本指南讲的是即使你的锚完美无缺,片段内部仍会发生什么。

运动预设真的能减少人物(而不只是产品)的形变吗?

能——这一原理可以推广:克制运动预设的存在,是因为脆弱主体——珠宝、玻璃器皿、精密机械——会随运动增强而更快失败,见 Haiper 的珠宝视频工作流。快速推近下的脸是同一个问题、更高的赌注:脆弱细节乘以运动等于失败倍增。运动克制阶梯就是产品拍摄运动预设的人物版。


结语

形变不是你必须容忍的模型局限——它是一个形状明确的提示词塑形问题。触发器是可识别的(竞争主体、损伤解剖结构的动词、贴近加速度、风格混用);防御性词汇跨模型通用;镜头距离遵循一条规则——先中景,特写循序争取;运动遵循阶梯,任何镜头不同时承担两种风险。当形变仍然出现时,分诊选出能保留好帧的最便宜修复——而反复出现的形变永远意味着提示词手术,绝不是更多重roll。

深入阅读:

建立主体,约束解剖,克制运动,争取特写——然后在发布前以四分之一速度拖动检查。


由 videosprompt.org 编辑团队审校 · 2026 年 10 月

分享文章

相关文章

推荐阅读

开始你的下一步

探索更多可能,发现适合你的解决方案。