原生音频 AI 视频 Prompt 技巧:跨模型的对白、音效与环境音
由 videosprompt.org 编辑团队审校 · 2026 年 10 月
TL;DR
- 原生音频意味着模型在生成画面的同时生成音轨——对白、音效与环境音在同一次生成中产出,而非后期叠加。
- 每条原生音频 prompt 都叠加三层——对白、音效、环境音——未指定的层会落入模型默认值(通用音乐、房间底噪或静音),因此每一层都需要显式指导。
- 对白 prompt 依赖说话人归属(”她说”)、口型同步提示、语气指导与语言指定;最常见的失败是语音重叠,需用显式的轮流发言来避免。
- 音效 prompt 使用一小套声音动词(”清脆的断裂声”、”金属叮当声”)、时机标记(”撞击瞬间”)以及画内音与画外音的取舍。
- 环境音 prompt 遵循”沉默是一种选择”原则:想要安静就写”不要音乐”——模型会把沉默当作遗漏,而非决定。
- 音频行为因模型而异:Veo 3.1 常开、Seedance 2.5 双语且受参考音频驱动、Kling 3.0 默认关闭、Wan 3.0 把音频当作一个图层——同一句话在每个模型上的分量不同。
- 附带按音频意图分类的 12 个模板:对白场景、音效驱动片段、环境音/ASMR,以及音乐卡点剪辑。
2026 年的”原生音频”意味着什么
原生音频指视频模型在生成画面的同一次过程中,生成同步的音轨——语音、音效与环境音。输出是一段音画对齐的成片,而不是等待后期混音的素材。
这从根本上改变了 prompt 的写法。在无声视频时代,prompt 只需要赢得一个画面。有了原生音频,prompt 同时也是一份混音简报:你省略的词不会保持安静,而会被填入默认值。
2026 年的格局由四种行为定义:
- Veo 3.1(Google DeepMind)始终开启。 每次生成都伴随音频,因此每条 prompt 都是音频 prompt。Google 的官方 Veo 页面将原生音频列为核心能力,而 Veo prompt cookbook 把对白指导、音效时机与环境音备注视为标准 prompt 组成部分。
- Seedance 2.5 支持双语音频与音频参考。 你可以在 prompt 中指定口语语言,并把音频参考交给模型来引导语气与节奏——音频既是输出也是输入。参见我们的 Seedance 2.5 prompt 指南。
- Kling 3.0 默认关闭音频。 它能生成音频,但静音输出是默认状态——Mstudio 的分模型 prompt 指南有文档说明。同一条 prompt、四个模型,有一个回来是哑的:通常原因就在这里。
- Wan 3.0 把音频当作附着在生成上的一个图层,这鼓励你像写镜头或灯光那样,为音轨命名。
实际结论:不再存在单一的”视频 prompt”。在常开模型上,你的音频句子是承重的;在默认关闭的模型上,它们休眠直到开关被打开;在参考驱动的模型上,它们要与参考音频所暗示的一切竞争。
三个音频图层:对白、音效与环境音
任何音轨,无论是生成的还是录制的,都可以拆成三个图层。把它们分别命名是原生音频 prompt 的核心纪律,因为无论你有没有要求混音,模型都会独立混合这三层。
| 图层 | 承载内容 | Prompt 关键词 | 未指定时的默认值 |
|---|---|---|---|
| 对白 | 台词、人声、嗓音语气 | “她说”、”他低声说”、”用英语” | 无语音,或模糊的嘟囔 |
| 音效(SFX) | 与画面动作绑定的离散声音 | “清脆的断裂声”、”撞击瞬间”、”钥匙叮当” | 被压低或夸张化的动作声 |
| 环境音 | 持续的环境底床 | “房间底噪”、”远处车流”、”屋外下雨” | 通用底床或死寂 |
三条规则支配图层之间的交互:
- 未指定的图层会拿到默认值,而不是安静。 只描述画面的 prompt 在常开模型上仍会产生音频——通常是平淡的底床和充满素材库感的音效。如果这一幕本该安静,就必须把安静写出来。
- 图层会争夺动态余量。 响亮的对白会埋掉精细的音效;密集的底床会吞掉脚步声。当片段混合多层时,要给它们排序:”对白清晰地压在柔和的雨声环境音之上”告诉模型哪一层获胜。
- 混音需要显式指导。 “她在下雨的厨房里一边倒咖啡一边说话”点名了三个图层,但没说它们的关系。改写成混音简报:”她的对白清晰地浮在倒咖啡的音效之上,雨声作为下方的低音底床。”同样的内容,确定的层级。
杠杆最大的习惯是决定每条片段由哪一个图层主导:对白主导的片段让音效稀疏、环境音压低;音效主导的片段(开箱、烹饪、ASMR)去掉对白;环境音主导的片段(睡眠、学习、氛围循环)把另外两层压到接近零。我们的 ASMR 风格 AI 视频 prompt 指南完整展示了一条音效主导的片段。
对白 Prompt:说话人、口型同步与语气
语音错误会被观众瞬间察觉:口型对不上、两个声音同时出现、语言不对、语气与表情矛盾。对白 prompt 的艺术在于逐一堵死这些失败。
说话人归属:写出”她说”
最可靠的对白原语是绑定在台词上的显式说话人归属:
- 为每句台词归属:”穿红大衣的女人说:’真不敢相信。’”
- 把语音绑定到走位:”他转向窗户说:’开始了。’”
- 镜头对准单张脸时,每个镜头只写一句带归属的台词。
归属把声音分配给特定的嘴,锚定轮流发言,并阻止声音在场景中途在角色之间漂移。语气住在同一个分句里——”她平淡地说”、”他凑近低声说”——因为放在 prompt 其他位置的语气词作用于整个场景,而不是那句话。
口型同步提示
每个有台词的镜头加一个口型同步提示:”特写,口型与台词同步”,或”她直视镜头说出这句,口型动作与音频匹配”。特写与直视镜头的表达同步最可靠;人脸很小的远景是模型最容易漂移的地方。如果一句台词很重要,就把景别收紧。
语言指定
在 Seedance 2.5 这类支持双语的模型上,语言是一个 prompt 标记:”她说:’[台词]‘——用普通话说。”不要假设模型能从角色名、场景或屏幕文字推断语言;每次都要按说话人指定,并在多语言片段中逐句归属(”她用法语回答;他用英语回应”)。
模型在哪里失败:重叠对白
最常见的失败是语音重叠——两个角色同时出声。模型倾向于这样做,因为”两个人在说话”在统计上更接近同时的嘈杂,而不是有纪律的轮流发言。用结构性的方式阻止它:
- “他们轮流说话;任何时刻只听到一个声音”
- “她说完台词,一拍沉默,然后他回答”
- “不要重叠对白;严格的轮流发言”
台词之间的一拍沉默也是给反应留出空间的最省力方式。长对话会迅速退化——把每条片段的对白限制在两句带归属的台词,让反应镜头承担其余部分。
音效 Prompt:声音动词、时机与画内画外
一个比画面撞击晚几帧触发的声音,读起来是坏掉,而不只是不完美。因此音效 prompt 分两半:声音是什么(词汇)和何时触发(时机)。
声音动词词汇表
声音动词要短、具体、可复用——每条片段两到四个,不能更多,否则混音会变成一锅粥。常用集合:
| 声音动词 | 触发时机 | 音色 |
|---|---|---|
crisp snap |
断裂、碎裂、茎秆折断、饼干掰开 | 明亮、瞬态 |
soft squish |
奶油、面团、泡沫、果冻的挤压 | 低沉、湿润 |
metallic clink |
餐具、盖子、钥匙、硬币相碰 | 明亮、细小 |
ceramic tap |
放下马克杯、盘子、瓷砖 | 中频、圆润 |
wet pop |
水滴、气泡、剥皮脱开 | 中频、圆润瞬态 |
dull thud |
书本、包裹、物体轻轻落地 | 低沉、短促 |
sharp crack |
冰块、干木头、蛋壳 | 明亮、有冲击 |
glass shatter |
窗户、瓶子、易碎物破碎 | 明亮、拖尾长 |
fabric rustle |
衣服、床品、窗帘 | 中频、类噪声 |
paper crinkle |
包装纸、书页、收据 | 高频、类噪声 |
liquid pour |
水流、咕嘟声、注满 | 持续、中频 |
keyboard clack |
打字、开关、按键 | 明亮、有节奏 |
每个动词都要配一个主体,让模型无法把它挂到错误的事件上:”巧克力掰开时一声清脆的断裂声”,而不是光秃秃的”清脆断裂声”。
时机同步:”撞击瞬间”
时机标记是同步用的介词。主力是“撞击瞬间”——”杯子落地,撞击瞬间一声陶瓷轻叩。”再为其余情况建一小套词汇:”盖子合上时”用于闭合动作、”刀刃触碰的瞬间”用于切割、”与剪辑点同步”用于剪辑驱动的声音、”在重拍上”用于音乐驱动的时机(见我们爆款短视频指南中的节拍标记)。时机标记要紧跟在动作分句之后——它们比收集在 prompt 末尾”audio”段落里的标记绑定得更紧。
画内音 vs. 画外音
画内音来自场景的世界——门闩扣上是因为有一只手扣上了它。画外音只为观众存在——甩镜时的呼啸、标题卡上的低频重击。两者都合法;混淆它们才是让片段显得业余的原因。
- 让声音保持画内:”所有声音都源自画面中可见的动作。”
- 请求画外处理:”镜头甩动时电影感的画外呼啸。”
短视频剪辑通常在叙事节拍上用画内音效,只在转场和标题处用画外重击。在完整的画内底床上叠加画外效果,是让混音过载最快的方式。
环境音 Prompt:房间底噪、环境底床与沉默原则
环境音是持续的图层——一个空间存在之声。它的缺失是被感觉到而不是被听到:没有房间底噪的片段听起来像真空包装,房间底噪不对的片段让人觉得场景在镜头中途换了地方。
房间底噪是室内的近乎无声的签名(”安静的房间底噪,微弱的空调嗡鸣”)。环境底床是户外或情境性的(”穿过松林的风”、”小雨之下的远处高速车流”)。把环境音结构为一张底床加至多一两个事件:只有事件没有底床的声音像掉进虚空;事件太多的底床会变成音效串烧。如果地理环境重要,在早段把底床命名一次,让它跨剪辑延续:”雨声底床在每个镜头下持续运行。”
“沉默是一种选择”原则
沉默是一种选择,而模型分不清选择与遗漏。没有被提及的音轨不会返回空白——它会带着模型认为安全的任何默认底床回来,而音乐是常见的一种。把安静当作内容写出来:
- “不要音乐;只要环境音”
- “除 [X] 外一片寂静”——点名唯一存活的那个声音
- “近乎无声的房间底噪,不要音乐,除翻页外不要任何音效”
否定是一等指令:你不想要的,点名并否定它;你想要的,用动词点名它。我们的多模态参考指南展示了音频参考如何钉住”安静”应该听起来是什么样,而不是听天由命。
模型支持矩阵:音频行为与 Prompt 影响
| 模型 | 音频行为 | 默认状态 | Prompt 影响 |
|---|---|---|---|
| Veo 3.1 | 常开原生音频;每个片段都生成对白、音效与环境音 | 音频始终存在 | 每条 prompt 都是混音简报。显式指导全部三层,否定你不想要的(”不要音乐”),并预期默认值会填补任何未指定的图层。 |
| Seedance 2.5 | 双语原生音频加音频参考输入 | 音频可用;风格可由参考引导 | 每次都按说话人指定语言。提供参考时,prompt 中的音频句子必须与之一致——矛盾会向参考一侧解决。 |
| Kling 3.0 | 具备原生音频能力,默认关闭 | 除非启用音频,否则静音 | 渲染前先启用音频;否则音频句子不起作用。启用后,常规的对白/音效/环境音规则照常适用。 |
| Wan 3.0 | 附着在生成上的音频图层 | 被请求时激活 | 把音频当作自己命名的轨道:”音频图层:对白压在小雨底床之上,不要音乐”——为图层命名可避免音频句子被读成画面描述。 |
这个矩阵推出两个跨模型习惯。第一,渲染任何长片段之前先跑一条单句音频 sanity 片段——”一只陶瓷马克杯被放在木桌上,撞击瞬间一声陶瓷轻叩,安静的房间底床,不要音乐”——用一次生成搞清楚音频是开的、静音的,还是默认成了音乐。第二,即使看起来理所当然也要写出混音层级,因为容忍度因模型而异:Kling 上一句客气的提示(音频可选),在 Veo 上是承重的(音频不可避免)。
按音频意图分类的 12 个 Prompt 模板
所有模板面向 9:16 短视频,可跨上述四个模型使用。在 Kling 3.0 上先启用音频;在 Veo 3.1 上把每条音频句子都当作必选指令;在 Seedance 2.5 上,语言标记是真正起作用的。
对白场景(3 个)
模板 D-1 — 轮流发言对白
Template: Two-Shot Turn-Taking Dialogue
Medium two-shot in a sunlit café booth. The woman in the red coat says,
"I can't believe you're actually leaving." A beat of silence, only her
face holding the reaction. The man looks down at his coffee and answers,
flat and quiet, "Neither can I." They speak one at a time — only one
voice is heard at any moment, no overlapping dialogue. Close-up on each
speaker as they deliver their line, lips in sync with the words.
Ambience: low café bed, faint cup clinks, no music. Vertical 9:16, 8 seconds.
模板 D-2 — 单人特写
Template: Direct-to-Camera Confession
Close-up of a young man in a dark hoodie against a plain concrete wall,
direct-to-camera delivery. He says, "Okay — so here's what nobody tells
you," spoken in English, tone urgent, leaning slightly into the lens.
Lips matched to the audio, shallow depth of field, single practical light
from the left. Audio: his voice clear and centered, faint hallway room
tone underneath, no music, no effects. Vertical 9:16, 6 seconds.
模板 D-3 — 动作上的旁白
Template: Non-Diegetic Voiceover
Overhead shot of hands packing a suitcase on a bed. A calm female
voiceover (non-diegetic — no speaker on screen) says, "Three days, one
bag, no plan." Soft fabric rustle and zipper pull diegetic with the
action, held under the voice. Ambience: quiet bedroom room tone, no music.
Her tone is warm and unhurried; dialogue layer leads, SFX sits beneath it.
Vertical 9:16, 7 seconds.
音效驱动(3 个)
模板 S-1 — 产品落地
Template: Product Drop on Impact
Slow-motion close-up of a matte-black wireless earbud case falling the
last six inches onto a concrete surface, bouncing once, settling. Camera
slightly below eye level, hard directional light raking across the
concrete. Audio: crisp snap on impact as the case lands, faint metallic
clink on the second bounce, scrape as it settles. Dry acoustic space, no
music, no ambience bed beyond a near-silent room floor. Vertical 9:16, 5 seconds.
模板 S-2 — 厨房节奏
Template: Chopping Board SFX Sequence
Macro tracking shot along a wooden cutting board as a chef's knife
prepares vegetables: a crisp snap as a celery stalk breaks, sharp crack
on the carrot, soft squish as tomato slices fall aside. Each sound fires
on impact with the blade touching the board. Rhythmic, even pacing —
one cut per beat. Ambience: low kitchen bed, faint refrigerator hum,
no music. Vertical 9:16, 7 seconds.
模板 S-3 — 纯画内音开箱
Template: Diegetic-Only Unboxing
Top-down shot of hands opening a rigid product box on a linen surface.
Paper crinkle as the seal tears, dull thud as the lid is set down, soft
foam squeak as the device is lifted, ceramic tap as it is placed beside
the box. All sound diegetic — every sound originates from an action
visible in frame, no non-diegetic effects, no music. Quiet room tone bed.
Vertical 9:16, 8 seconds.
环境音 / ASMR(3 个)
模板 A-1 — 雨窗,沉默选择
Template: Rain Window Sleep Loop
Static shot of a rain-streaked window at night, city bokeh soft and
out of focus beyond the glass. Ambience: steady rain on glass as a
continuous bed, one distant thunder roll at the four-second mark, faint
room tone behind it. No music, no dialogue, no effects beyond the rain.
Quiet, slow, hypnotic pacing. Vertical 9:16, 10 seconds.
模板 A-2 — 森林清晨底床
Template: Forest Ambience Bed
Slow push-in through a pine forest at dawn, low mist between trunks,
light shafts from the upper right. Ambience: soft wind in leaves as the
base bed, sparse far-off birdsong, one closer bird call at the midpoint.
No music, no dialogue, no human-made sound. Natural, unhurried pacing.
Vertical 9:16, 10 seconds.
模板 A-3 — 近乎无声的翻页(ASMR)
Template: Near-Silence Page Turn
Macro close-up of a hardcover book open on a wool blanket, one page
turning in slow motion, fibres visible in the paper under warm
directional light. Audio: near-silence — soft room tone only — with a
single paper crinkle as the page lifts and a soft whisper of paper as it
settles. No music, no ambience bed beyond room tone, no dialogue.
Binaural feel for headphone playback. Vertical 9:16, 6 seconds.
音乐卡点(3 个)
模板 M-1 — 节拍响指换装转场
Template: Beat-Synced Outfit Transition
Vertical hook: a woman stands in a hallway; on the downbeat of an upbeat
lo-fi track she snaps her fingers and the outfit transforms — three cuts
at 0.8-second intervals, each cut synchronized to a snare hit. Her snap
is a crisp diegetic transient layered over the music; footsteps and
fabric rustle sit low beneath the track. Music is the lead layer, SFX
secondary, no dialogue, thin street ambience bed. Vertical 9:16, 8 seconds.
模板 M-2 — 重拍上的烹饪蒙太奇
Template: Percussive Cooking Montage
Fast-cut cooking montage: pan flip, herb sprinkle, plate landing —
each cut synchronized to the downbeat of a driving percussion track.
Diegetic kitchen SFX punctuate the rhythm: metallic clink of the pan,
liquid pour, ceramic tap as the plate lands, all on impact and locked
to the beat. Music leads the mix; SFX accent it; no dialogue; minimal
kitchen ambience under everything. Vertical 9:16, 9 seconds.
模板 M-3 — 纯音乐电影感揭示
Template: Music-Only Reveal
Wide drone shot rising over a foggy mountain ridge at sunrise, camera
crane-up revealing the valley. Audio: a single cinematic track — soft
strings swelling to a crescendo as the valley appears — with no
dialogue, no SFX, and only a faint wind bed mixed nearly to silence
underneath the music. Music layer leads completely; nothing competes
with the swell. Vertical 9:16, 10 seconds.
FAQ
1. AI 视频生成中的”原生音频”是什么意思?
原生音频指模型在生成视频的同一次过程中生成音轨——对白、音效与环境音——而且已经同步。没有任何东西是后期添加的,因此 prompt 同时充当混音简报:你写出的音频句子成为指令,你省略的句子变成模型默认值。
2. 如果我的模型总是生成声音,我还需要音频指令吗?
需要——比以往更需要。在 Veo 3.1 这类常开模型上,不受指导的音频不会保持安静;它会被通用底床和素材库感的音效填满。显式的音频句子用有意图的混音替换默认混音,而”不要音乐”这类否定会压制你不想要的默认值。Veo prompt cookbook 正因如此才把音频提示纳入其标准 prompt 结构。
3. 为什么我的某个模型渲染同一条 prompt 时是无声的?
多半是默认状态差异,而不是 prompt 的 bug。Kling 3.0 除非启用音频,否则输出静音视频——Mstudio 的分模型 prompt 指南有文档说明——而 Veo 3.1 每次生成都会附带音频。渲染长片段之前,在每个模型上先跑一条单句音频 sanity 片段,并把各模型的音频开关写进你的工作流清单。
4. 如何阻止两个角色互相抢话?
把轮流发言写成指令:”他们轮流说话——任何时刻只听到一个声音,不要重叠对白。”把每句台词归属给特定说话人,在台词之间插入一拍沉默,并把片段限制在两句带归属的台词。重叠是”两个人在说话”的统计默认值,因此必须用结构性的方式覆盖它。
5. 如何指定角色说什么语言?
在言语分句内部按说话人陈述语言:”她说:’[台词]‘——用普通话说。”不要依赖角色名、场景或屏幕文字来暗示语言。Seedance 2.5 这类支持双语的模型会遵守显式语言标记;在其他模型上,这个标记至少给模型一个一致的目标,而不是让它猜。
6. 画内音效与画外音效有什么区别?
画内音效来自场景内部的源头——门闩扣上是因为有一只手扣上了它。画外音效只为观众存在——甩镜时的呼啸、标题卡上的重击。让叙事音效保持画内,把画外重击留给转场和标题,并在重要时写明:”所有声音都源自画面中可见的动作。”
7. 我的片段应该很安静——为什么回来带着音乐?
因为沉默是模型无法从遗漏中推断出的选择;未被提及的音轨会拿到一个安全默认值,而音乐是常见的一种。把安静显式写出来:”不要音乐;只要环境音”,或”近乎无声的房间底噪,除翻页外什么都没有”。否定是一等的 prompt 指令。
结语
原生音频把每条视频 prompt 变成了混音简报。模型让音轨变得不可避免——Veo 3.1 上常开、Seedance 2.5 上双语且由参考引导、Kling 3.0 上需主动开启、Wan 3.0 上作为图层叠加——而创作者的工作是指导全部三层,而不是让默认值去填补它们。这套技巧归结为一份清单:对白要为每句台词归属并强制轮流发言;音效要把声音动词绑定主体并”撞击瞬间”触发;环境音要指定一张底床加一两个事件;只要想要安静就写”不要音乐”。在默认关闭的模型上,先拨开关——否则世界上最好的音频句子也会渲染成沉默。
从 sanity 片段开始,挑一个匹配你音频意图的模板,每次只调整一个图层。想深入练习:Veo 3.1 原生音频深度解析讲常开音频;Seedance 2.5 prompt 指南讲双语输出与音频参考;ASMR 风格 prompt 库延伸音效与环境音章节;爆款短视频 prompt 指南讲节拍卡点的时机标记;多模态参考视频指南展示音频作为输入而不只是输出。
由 videosprompt.org 编辑团队审校 · 2026 年 10 月
分享文章