ASMR 风格 AI 视频提示:声音设计、微距美学与主题分类
由 videosprompt.org 编辑团队审校 · 2026 年 10 月
TL;DR
- 生成式视频中的 ASMR 主要是一种视觉类型:微距特写、慢动作构图、浅景深、湿润/带质感表面,搭配一套克制的音频语法(清脆、柔软、湿润、金属感等声音动词)。
- 该格式同时激活两条奖励回路:慢动作对称性带来的视觉满足,与高密度触发音带来的听觉满足——2026 年原生音频模型可仅凭一条提示同时生成这两者。
- 本指南提供 12 个即用模板,覆盖五大 ASMR 领域,每条带显式
ASMR audio:行。 - 默认音频底是不使用音乐;节奏明快的背景音乐会毁掉整个类型。
- Veo 3.1 拥有最可靠的原生音频管线;Seedance 2.5 支持音频参考层;Kling 3.0 和 Wan 3.0 在简单触发音场景下可用。
ASMR 在屏幕上的表现
ASMR 起源于音频优先的格式——耳语独白、翻页声、揉皱声——大多使用双耳麦克风录制。到 2026 年,TikTok、Reels、Shorts 上的主流 ASMR 已是视频优先,音频几乎只是视觉的副产品。两者密不可分:没有令人满足的声音,画面显得平淡;没有令人满足的画面,声音沦为背景噪音。
生成式视频能独特地交付 ASMR,得益于 2025–2026 年落地的两项能力:与画面绑定的原生音频生成(Veo 3.1、Seedance 2.5、最新 Wan 版本),以及保持表面质感的慢动作微距构图。一条提示就能精确组合触发 ASMR 反应的全部要素——可见的表面纹理、慢动作动作、落在视觉高潮处的声音动词。
本指南面向使用生成式视频为社交、电商主视觉循环和产品发布制作 ASMR 片段的创作者、品牌营销人员和提示词工程师。提示在主流模型间可移植,支持音频感知,竖屏优先。
ASMR 视觉语法
每条表现优异的 ASMR 片段都遵循相同的四条视觉规则。
1. 微距特写
画面充满质感——一片柑橘、一滴精华、一道玻璃裂痕、一段织物褶皱。镜头足够近,观众能看清表面微结构。微距不是可选项,而是 ASMR 与普通内容的分水岭。
2. 慢动作(60–240fps 时间拉伸)
两秒的脆响变成四秒,一滴液体花六秒落下。时间是生成式视频中最廉价的特效,ASMR 要求在令人满足的瞬间具备时间弹性。须在提示词中明确指定慢动作。
3. 浅景深
焦点主体锐利,前后一切化为柔和虚化。浅景深告诉观众目光该看向哪里,也让质感更突出。深景深读起来像纪录片,浅景深则亲密——ASMR 在定义上就是亲密的。
4. 湿润或带质感的表面
光线反弹,釉料汇聚、糖浆滴落、露珠凝结、织物起皱、玻璃折射。视觉语言更接近奢侈美妆广告。哑光、干燥或均匀的表面毫无生气,会破坏触发回路。
| 视觉线索 | 触发功能 | 常见错误 |
|---|---|---|
| 微距特写 | 激活质感识别 | 中景(丢失微结构) |
| 慢动作(60–240fps) | 拉伸触发瞬间 | 实时光速(像家庭视频) |
| 浅景深 | 引导视线聚焦主体 | 深焦(读起来像纪录片) |
| 湿润/带质感表面 | 传递新鲜与触感 | 哑光/均匀表面(毫无生气) |
类型以视觉语法为主、音频语法为辅。视觉不对,再多音频也救不回来。见 Google AI Studio Veo prompt cookbook。
ASMR 音频语法
音频是平淡画面与类型正确的 ASMR 片段之间的分界线。语法高度克制——动词更少、纪律更严、强烈反对音乐。
声音动词词汇表
使用简短、可复用的词汇,每条片段用二到四个动词——再多则音频底变嘈杂,丧失触发清晰度。
| 动词 | 触发瞬间 | 最适合 |
|---|---|---|
crisp snap |
刀具切水果、饼干断裂、茎部折断 | 食物、材质 |
soft squish |
奶油、面团、果冻、泡沫 | 食物、护肤 |
wet pop |
气泡、液滴、果皮剥离 | 护肤、物件 |
metallic clink |
盖子扣合、玻璃敲击、器具碰响 | 材质、物件 |
ceramic tap |
勺子碰杯、盘子落台 | 食物、材质 |
water trickle |
倾倒液流、雨声、冲洗 | 食物、环境 |
paper crinkle |
包装纸、纸巾、翻页 | 材质 |
fabric rustle |
布料移动、毛巾折叠 | 材质 |
下方每个模板的 ASMR audio: 行均包含两到三个动词。
双耳录音提示
对于耳机优先的平台,可加入 binaural recording 提示,引导支持空间音频的模型生成模仿双耳麦克风采集效果的立体声像——声音具有左右位置,是录制型 ASMR 最具辨识度的特征。Veo 3.1 和 Seedance 2.5 可靠解析;Kling 3.0 和 Wan 3.0 不稳定。
“无音乐”默认
ASMR 提示词最常见的错误是加入音乐。ASMR 音频只有触发音,可选地加上微弱室内底噪或淡混响尾巴。节奏明快的 lo-fi 底或任何旋律元素都会与触发瞬间争夺注意力,将类型从 ASMR 推向”带配乐的解压视频”。默认不使用音乐。
词汇扩展:ASMRify 食物 ASMR 生成器;Filmora ASMR 烹饪视频指南。模型不生成原生音频时的后期分层:Sparki 食物 ASMR 剪辑指南。
五大 ASMR 主题类别
ASMR 已收敛于五大主题领域,各有不同的触发词汇、表面美学和营销用例。
1. 食物 ASMR
TikTok 上最受欢迎的赛道。触发动词:slice、snap、drizzle、squish、crunch。表面美学:光泽、湿润、晶亮。最适合:零食品牌、饮品发布、糖果营销、食谱内容。与工业隧道赛道相邻——见 AI 食品包装生产线提示。
2. 护肤 ASMR
2026 年观看量紧随其后。触发动词:drop、spread、pump、tap、pop。表面美学:湿润、反光、黏稠,精华与面霜质地捕捉光线。最适合:护肤品牌、美妆零售商、皮肤科内容。生产线变体见 AI 护肤美妆生产线提示。
3. 材质 ASMR
竞争更少,氛围更浓。触发动词:crinkle、fold、tap、scrape。表面美学:纸张纹理、织物编织、玻璃折射。最适合:文具品牌、奢侈包装、纺织品营销、手工艺品。
5. 物件 ASMR
变化丰富,常带超现实感。触发动词:crack、pour、settle、shimmer。表面美学:水晶刻面、砂砾颗粒、史莱姆黏度。最适合:水晶零售、美术用品、玩具品牌、奇珍异趣内容。
5. 环境 ASMR
最接近传统录制型 ASMR。触发动词:trickle、crackle、wash、hum。表面美学:窗上雨滴、海浪翻涌、火焰余烬、风过草地。最适合:助眠应用、冥想产品、酒店品牌、lo-fi 学习频道。
五大类别共享同一套语法,但在触发动词和表面质地上不同。每片段选一个类别;同一镜头混合食物和环境会显得混乱。
12 个 ASMR 提示模板
每个模板都是自包含的提示,可直接粘贴到生成式视频模型中。以可移植性为目标——自然语言描述,适用于 Veo 3.1、Seedance 2.5、Wan 3.0、Kling——每条均含显式 ASMR audio: 行。
食物 ASMR(3)
模板 F-01 — 柠檬切片
Macro close-up of a single lemon being sliced in cross-section. A thin sharp knife passes through the rind in slow motion; juice droplets bead on the cut surface and a single droplet falls in slow-motion stretch. Shallow depth of field, soft directional window light from upper-left. ASMR audio: crisp snap of the rind, wet pop as juice releases, soft drip on a wooden board. Binaural recording, no music. Vertical 9:16, 6 seconds.
模板 F-02 — 蜂蜜淋制
Macro close-up of golden honey being drizzled in a thin steady stream onto a slice of toasted brioche. The honey pools and folds in slow motion, catching light as it thickens. Soft window light from upper-left. Shallow depth of field. ASMR audio: continuous soft drizzle, wet pop as the stream lands, faint paper crinkle from the bread surface. Binaural recording, no music. Vertical 9:16, 8 seconds.
模板 F-03 — 巧克力断裂
Macro close-up of a thin dark chocolate bar being broken in half. The snap propagates across the surface in slow motion; the broken edge reveals a clean snap and a glossy interior. Soft warm light from upper-left. Shallow depth of field. ASMR audio: crisp snap of the break, soft crumble as shards settle, faint ceramic tap as a piece is set on a small plate. Binaural recording, no music. Vertical 9:16, 6 seconds.
护肤 ASMR(3)
模板 S-01 — 精华液滴落
Macro close-up of a single drop of hyaluronic serum falling from a glass dropper onto the back of a hand. The drop forms, detaches, and lands in slow-motion stretch, spreading into a dewy reflective sheen. Soft cool light from upper-left. Shallow depth of field. ASMR audio: wet pop as the drop detaches, soft spread as it lands, faint metallic clink as the dropper is returned to the bottle. Binaural recording, no music. Vertical 9:16, 6 seconds.
模板 S-02 — 面霜按压
Macro close-up of a pump dispenser releasing a thick white moisturiser onto a ceramic dish. The cream holds its shape briefly, then slowly settles and spreads. Soft cool light. Shallow depth of field. ASMR audio: soft pump hiss, soft squish as the cream is extruded, faint ceramic tap. Binaural recording, no music. Vertical 9:16, 8 seconds.
模板 S-03 — 面膜展开
Macro close-up of a folded sheet mask being lifted and unfolded in slow motion. The fabric stretches and drapes, revealing a wet dewy surface glistening with essence. Soft cool light. Shallow depth of field. ASMR audio: soft fabric rustle, wet pop as the essence beads release, faint paper crinkle as the packaging is set aside. Binaural recording, no music. Vertical 9:16, 8 seconds.
材质 ASMR(2)
模板 M-01 — 纸张揉皱
Macro close-up of a sheet of textured handmade paper being crumpled and then smoothed flat in slow motion. Visible texture and fibre inclusions. Soft warm light from upper-right. Shallow depth of field. ASMR audio: continuous paper crinkle, soft rustle as it is smoothed, faint ceramic tap as a paperweight is set. Binaural recording, no music. Vertical 9:16, 6 seconds.
模板 M-02 — 玻璃折射
Macro close-up of a crystal glass tumbler being set down on a marble surface. Light refracts through the glass and casts a soft spectrum on the marble. Slow-motion impact. Soft warm light. Shallow depth of field. ASMR audio: ceramic tap on marble, soft ring as the glass vibrates, faint scrape as it is centred. Binaural recording, no music. Vertical 9:16, 6 seconds.
物件 ASMR(2)
模板 O-01 — 水晶倾泻
Macro close-up of a small pile of amethyst crystals being poured from a velvet pouch onto a dark wooden surface. Each crystal catches light individually as it settles. Slow-motion pour. Soft directional light from upper-left. Shallow depth of field. ASMR audio: continuous soft tumble, metallic clink as facets touch, faint velvet rustle as the pouch is shaken. Binaural recording, no music. Vertical 9:16, 8 seconds.
模板 O-02 — 史莱姆拉伸
Macro close-up of a translucent glitter slime being slowly stretched between two fingers. The slime thins into a glossy strand and snaps back. Soft cool light. Shallow depth of field. ASMR audio: soft squish as it stretches, wet pop as it snaps back, faint finger tap on the surface. Binaural recording, no music. Vertical 9:16, 6 seconds.
环境 ASMR(2)
模板 A-01 — 玻璃上的雨
Macro close-up of raindrops forming on a windowpane, merging, and rolling down in slow motion. Each droplet catches the light from an interior lamp. Shallow depth of field. ASMR audio: continuous water trickle, soft droplet pop as drops merge, faint distant wash. Binaural recording, no music. Vertical 9:16, 10 seconds.
模板 A-02 — 烛焰余烬
Macro close-up of a single candle flame flickering in slow motion. Wax pools at the base and a soft curl of smoke rises. Warm directional light. Shallow depth of field. ASMR audio: faint wax crackle, soft hum of the wick, faint smoke hiss. Binaural recording, no music. Vertical 9:16, 8 seconds.
负面提示基线
排除什么与包含什么同等重要。ASMR 有四项内容禁区。
节奏明快的音乐。 旋律底色、lo-fi 循环、带变化的合成器铺底——任何这些都会将作品从”ASMR 触发”推向”带配乐的解压视频”。默认不使用音乐;若需要底色,用持续低频嗡鸣。
快速剪辑。 ASMR 是时间弹性艺术。6 秒片段出现三次剪辑读起来像集锦,而非触发。每片段一次连续镜头,或最多一次转场。若模型默认会切换镜头,明确指定 continuous shot, no cuts。
画面中出现动作产品的人手。 镜头中出现手会将类型推向教程或开箱。工匠风调性中,画面边缘出现一只手可接受,但主动展示或转动产品的手会被读作网红内容。
字幕覆盖触发瞬间。 字幕可放画面下三分之一处,但绝不覆盖视觉高潮——声音动词落在触发动作上的那一刻。
可加在任一模板前的负面提示行:
Negative: no music, no fast cuts, no hands in frame, no captions over the trigger moment, no upbeat audio bed.
ASMR 音频 + AI 模型支持
原生音频生成在 2026 年模型生态中成熟度参差不齐——一些模型能生成丰富、触发准确的 ASMR 音频,另一些只能生成平淡的环境嗡鸣。
| 模型 | 原生 ASMR 音频 | 触发动词解析 | 双耳提示 | 备注 |
|---|---|---|---|---|
| Veo 3.1 | 强 | 强 | 支持 | 最可靠的原生音频管线;每条提示解析 3–4 个动词;生成空间立体声像。见 Veo 3.1 原生音频 4K 解析。 |
| Seedance 2.5 | 强(音频参考层) | 强 | 支持 | 支持视觉提示外的显式音频参考片段;最适合复用已知 ASMR 音轨。见 Seedance 2.5 多镜头指南。 |
| Kling 3.0 | 有限 | 中 | 不稳定 | 稳定生成环境音频,但特定触发动词吃力;通常需后期分层。 |
| Wan 3.0 | 中(音频层) | 中 | 有限 | 音频作独立层生成;可重新混音,但很少以帧级精度落在视觉触发点上。 |
| Hailuo / MiniMax 模型 | 不定 | 中 | 不支持 | 视模型而定,逐版本验证。 |
实际意义:上述模板下,Veo 3.1 是最稳妥的单模型选择;多镜头需一致音频底时,Seedance 2.5 搭配音频参考是最强方案;Kling 和 Wan 适用于一两个触发的较短片段,触发密集序列需计划后期分层。
面向 TikTok/Reels 触发密集短音频场景,见 病毒式 AI 短视频提示指南;ASMR 的晨间 vlog 近亲见 晨间 vlog AI 提示指南。
常见问题
1. ASMR 风格 AI 视频与普通慢动作微距视频有何区别?
普通慢动作微距视频是视觉技法;ASMR 是感官格式,将视觉与高度克制的触发音音频语法以及刻意缺席的音乐搭配在一起。一段带节奏明快 lo-fi 底色的咖啡慢动作微距视频只是慢动作微距;同样的画面配上 soft drizzle, faint ceramic tap, no music 音频行,就是 ASMR。音频语法才是定义类型的关键。
2. 这些提示是否也适用于环境 ASMR(雨、火、海浪)?
可以。五大类别共享同一套视觉语法(微距、慢动作、浅景深、湿润/带质感表面),仅在触发动词和主题上不同。环境模板(A-01、A-02)适合助眠、冥想和酒店类内容。拓展时沿用相同模式扩展到风过草地、远处雷声、叶上水珠即可。
3. 每条 ASMR 提示都需要指定”binaural recording”吗?
有帮助但非必需。双耳录音是空间音频采集技术,将声音放置在立体声场中模拟人耳听觉。若受众用耳塞收听(绝大多数 TikTok 和 Reels 场景),双耳录音带来更具沉浸感的触发;若模型不支持,类型仍然成立。
4. ASMR 触发的理想片段时长是多少?
四到十秒。短于四秒,触发来不及落地,奖励回路无法闭合;长于十秒,触发密度下降,片段变得冥想化。若需要更长主视觉循环,可用 0.3 秒的交叉淡入淡出,拼接三到四个短触发。
5. 这些提示可用于静态图片,仅限视频吗?
提示为视频编写,但大多数可通过移除时间动词(slow motion、in slow-motion stretch)、移除 ASMR audio: 行、保留材质和构图线索,适配静态图片生成器。示例见 Filmora ASMR 烹饪指南。
6. 若模型不生成原生音频,如何在后期处理 ASMR 音频?
两种方案。较简单的:叠一层免版税 ASMR 音频底(双耳雨声、火焰噼啪、纸张揉皱)。更好的方案:录制或寻得与画面具体触发相匹配的自定义音频底——一段真实的 crisp snap 用于巧克力断裂,一段真实的 wet pop 用于精华液滴落。EQ 与频段选择见 Sparki 食物 ASMR 剪辑指南。
7. 画面中应否出现人手?
通常不应。镜头中出现手会将类型推向教程或开箱。例外:工匠风食物调性中,画面边缘短暂出现一只手。护肤和材质 ASMR 几乎从不出现手;环境 ASMR 从不出现手。若产品需要手提供语境(如精华滴管、面膜展开),让手快速进入和离开画面,焦点动作居中放在产品上。
结论
ASMR 是当下生成式视频中最可复制的视觉加音频语法之一:规则紧凑、输入受限。一个微距特写、慢动作、浅景深、湿润或带质感表面,以及一条由二到四个动词组成的显式音频行——这五个要素组合起来,在任何 2026 年主流模型中都能输出类型正确的结果。
剩下的功夫在于动词纪律:建立一组二到四个触发动词的简短词汇,在整个推广活动中保持一致,不让任何模板漂移到其他类别。胜出的品牌并非制作预算最大的,而是那些在每条片段中保持相同灯光和音频词汇的品牌。
十二个模板是初始集合。渲染完它们、了解了所选模型对 ASMR audio: 行的响应后,针对你的产品或主题自行编写三到四条——保持结构模式,更换触发动词。
食品包装工业隧道近亲:AI 食品包装生产线提示。护肤生产线变体:AI 护肤美妆生产线提示。晨间 vlog 模式:晨间 vlog AI 提示指南。Veo 3.1 原生音频管线:Veo 3.1 原生音频 4K 解析。Seedance 音频参考层:Seedance 2.5 多镜头指南。短视频节奏与钩子:病毒式 AI 短视频提示指南。
由 videosprompt.org 编辑团队审校 · 2026 年 10 月
分享文章