تقنيات برومبت الفيديو بالذكاء الاصطناعي والصوت الأصلي: الحوار ومؤثرات الصوت والأجواء عبر النماذج
تمت المراجعة من قبل فريق تحرير videosprompt.org · أكتوبر 2026
الخلاصة في سطور
- الصوت الأصلي يعني أن النموذج يولّد مسار الصوت مع الصورة — حوار ومؤثرات صوتية وأجواء تُنتَج في جولة التوليد نفسها، لا تُضاف لاحقًا في مرحلة ما بعد الإنتاج.
- كل برومبت بالصوت الأصلي يقوم على ثلاث طبقات — الحوار، ومؤثرات الصوت، والأجواء — والطبقات غير المحددة تتلقى الإعدادات الافتراضية للموديل (موسيقى عامة، أو همس غرفة، أو صمت)، لذلك تحتاج كل طبقة إلى توجيه صريح.
- برومبت الحوار يعتمد على إسناد المتحدث (“هي تقول”)، وإشارات مزامنة الشفاه، وتوجيه النبرة، وتحديد اللغة؛ وأشهر إخفاق هو تداخل الكلام، ويُمنع ذلك بتحديد الدور صراحةً.
- برومبت مؤثرات الصوت يستخدم معجمًا محدودًا من أفعال الصوت (“طقطقة حادة”، “رنين معدني”)، ورموز التوقيت (“عند الاصطدام”)، وقرار الصوت داخل الفضاء السردي مقابل خارجه.
- برومبت الأجواء يتبع مبدأ “الصمت خيار”: إن تريد هدوءًا، اكتب “بلا موسيقى” — فالنماذج تقرأ الصمت كغياب لا كقرار.
- يختلف سلوك الصوت من نموذج لآخر: Veo 3.1 مفعّل دائمًا، وSeedance 2.5 ثنائي اللغة وموجّه بالمراجع، وKling 3.0 معطّل افتراضيًا، وWan 3.0 الصوت فيه طبقة — والجملة نفسها تحمل وزنًا مختلفًا في كل نموذج.
- يتضمن المقال 12 قالبًا مصنفة حسب النية الصوتية: مشاهد حوارية، ومقاطع مدفوعة بمؤثرات الصوت، وأجواء/ASMR، ومونتاجات متزامنة مع الموسيقى.
ماذا يعني الصوت الأصلي في 2026
الصوت الأصلي هو توليد نموذج فيديو لمسار صوتي متزامن — كلام ومؤثرات صوتية وأجواء — في الجولة نفسها التي تنتج فيها الصورة. الناتج يصل كمقطع مكتمل الصوت والصورة متزامنين، لا كلقطات بانتظار خلط صوتي في ما بعد الإنتاج.
هذا يغيّر كتابة البرومبت جذريًا. في عصر الفيديو الصامت، كان على البرومبت أن يُقنع فقط بالبصريات. ومع الصوت الأصلي، يصبح البرومبت أيضًا موجز خلط صوتي: الكلمات التي تتركها خارج النص لا تبقى صامتة، بل تحصل على إعداد افتراضي.
يُحدَّد المشهد في 2026 بأربع سلوكيات:
- Veo 3.1 (Google DeepMind) مفعّل دائمًا. الصوت يرافق كل توليد، لذا كل برومبت هو برومبت صوتي. صفحة Veo الرسمية من Google تُقدّم الصوت الأصلي بوصفه قدرة أساسية، ودليل كتابة البرومبت الخاص بـ Veo يعامل توجيه الحوار وتوقيت مؤثرات الصوت وملاحظات الأجواء كمكونات قياسية للبرومبت.
- Seedance 2.5 يدعم الصوت ثنائي اللغة ومرجعات الصوت. يمكنك تحديد لغة الكلام في البرومبت وتسليم النموذج مرجعًا صوتيًا لتوجيه النبرة والإيقاع — الصوت كمدخل لا كمخرج فقط. راجع دليل برومبت Seedance 2.5.
- Kling 3.0 الصوت فيه معطّل افتراضيًا. يستطيع توليد الصوت، لكن الناتج الصامت هو الحالة الافتراضية — موثّقًا في دليل كتابة البرومبت لكل نموذج من Mstudio. برومبت واحد، أربعة نماذج، واحد يعود أصم: هذا هو السبب عادةً.
- Wan 3.0 يعامل الصوت كطبقة مرفقة بالتوليد، ما يشجع على برومبتات تسمّي مسار الصوت كما تسمّي الكاميرا أو الإضاءة.
الخلاصة العملية: لم يعد هناك “برومبت فيديو” واحد. على النماذج المفعّلة دائمًا تكون جملك الصوتية حاملة للأحمال؛ وعلى النماذج المعطّلة افتراضيًا تبقى خاملة حتى يُفعَّل مفتاح؛ وعلى النماذج الموجّهة بالمراجع تنافس كل ما يفترضه المرجع.
الطبقات الصوتية الثلاث: الحوار ومؤثرات الصوت والأجواء
كل مسار صوتي — مولَّدًا كان أو مسجّلًا — يتفكك إلى ثلاث طبقات. تسميتها منفصلة هو الانضباط الأساسي في برومبت الصوت الأصلي، لأن النماذج تخلط هذه الطبقات بغض النظر عما طلبت أم لا.
| الطبقة | ما تحمله | كلمات مفتاحية في البرومبت | الافتراضي عند عدم تحديدها |
|---|---|---|---|
| الحوار | الكلمات المنطوقة، الصوت، نبرة الصوت | “هي تقول”، “همس”، “بالإنجليزية” | بلا كلام، أو همس عام |
| مؤثرات الصوت (SFX) | أصوات محددة مرتبطة بإجراءات على الشاشة | “طقطقة حادة”، “عند الاصطدام”، “رنين المفاتيح” | أصوات مكتومة أو مبالغ فيها |
| الأجواء | طبقة بيئية مستمرة | “صوت الغرفة”، “حركة بعيدة”، “مطر في الخارج” | طبقة عامة أو صمت تام |
ثلاث قواعد تحكم تفاعل الطبقات:
- الطبقات غير المحددة تحصل على افتراضيات، لا على صمت. برومبت يصف البصريات فقط لا يزال يولّد صوتًا على نموذج مفعّل دائمًا — عادةً طبقة باهتة ومؤثرات بنكهة جاهزة. إن كانت المشهد مُرادًا هادئًا، فيجب كتابة ذلك الهدوء.
- الطبقات تنافس على مساحة الرأس. الحوار المرتفع يطمر مؤثرات الصوت الدقيقة؛ والطبقة الكثيفة تبتلع الخطوات. عندما يخلط المقطع بين طبقات، رتّبها: “حوار واضح فوق أجواء مطر خفيفة” يخبر النموذج أي طبقة تفوز.
- الخلط يتطلب توجيهًا صريحًا. “هي تتحدث بينما تصب القهوة في مطبخ تمطر” تسمّي الطبقات الثلاث لكنها لا تحدد علاقتهما. أعد صياغتها كموجز خلط: “يجلس حوارها واضحًا فوق مؤثرات الصب، والمطر طبقة منخفضة تحته.” المحتوى نفسه، مع تسلسل هرمي حتمي.
أنفع عادة هي تحديد الطبقة الواحدة التي تقود كل مقطع: المقاطع ذاتية الحوار تُبقي مؤثرات الصوت شحيحة والأجواء منخفضة؛ المقاطع ذاتية المؤثرات (فتح الصناديق، الطبخ، ASMR) تحذف الحوار؛ المقاطع ذاتية الأجواء (النوم، المذاكرة، حلقات المزاج) تُبقي الاثنتين الأخرىتين قرب الصفر. يعرض دليل برومبتات الفيديو بالذكاء الاصطناعي بأسلوب ASMR مقطعًا مدفوعًا بالمؤثرات من البداية إلى النهاية.
برومبت الحوار: المتحدثون ومزامنة الشفاه والنبرة
يشاهد المشاهد أخطاء الكلام فورًا: شفاه غير متطابقة، صوتان في آن واحد، لغة خاطئة، نبرة تتعارض مع الوجه. فن برومبت الحوار هو إغلاق باب كل إخفاق قبل وقوعه.
إسناد المتحدث: اكتب “هي تقول”
أكثر عناصر الحوار الأساسية موثوقية هو الإسناد الصريح للمتحدث مربوطًا بالسطر:
- أسند كل سطر: “المرأة المعطف الأحمر تقول: ‘لا أصدق ذلك.’”
- اربط الكلام بحركة التمثيل: “يلتفت إلى النافذة ويقول: ‘بدأ الأمر.’”
- سطر مسند واحد لكل لقطة عندما تكون الكاميرا على وجه واحد.
الإسناد يربط الصوت بفم محدد، ويُثبّت تبادل الأدوار، ويمنع هجرة الصوت بين الشخصيات وسط المشهد. النبرة تسكن في الشرط نفسه — “تقول ببرود”، “يهمس منحنيًا نحوها” — لأن كلمات النبرة الموضوعة في مكان آخر من البرومبت تنطبق على المشهد لا على الجملة.
إشارات مزامنة الشفاه
أضف إشارة مزامنة شفاه واحدة لكل لقطة كلام: “لقطة قريبة، الشفاه متزامنة مع السطر”، أو “تلقي العبارة مباشرة نحو الكاميرا، مع مطابقة حركة الفم للصوت.” اللقاطات القريبة والإلقاء المباشر نحو الكاميرا تتزامن بأعلى موثوقية؛ أما اللقطات الواسعة بالوجوه الصغيرة فهي موضع انحراف النماذج. إن كان للسطر أهمية، قرّبه.
تحديد اللغة
على النماذج القادرة على ثنائية اللغة مثل Seedance 2.5، اللغة رمز في البرومبت: “تقول: ‘[السطر]’ — منطوقة بالصينية.” لا تفترض أن النموذج يستنتج اللغة من الأسماء أو المكان أو النص على الشاشة؛ حددها لكل متحدث في كل مرة، وأسند الأسطر سطرًا سطرًا في المقاطع متعددة اللغات (“تجيب بالفرنسية؛ وهو يرد بالإنجليزية”).
أين تفشل النماذج: تداخل الحوار
الإخفاق الأكثر شيوعًا هو تداخل الكلام — كلا الشخصيتين يُصدر الصوت في آن واحد. تنجذب النماذج إليه لأن “شخصين يتحدثان” إحصائيًا أقرب إلى الثرثرة المتزامنة منه إلى تبادل منضبط. امنعه هيكليًا:
- “يتكلمان بالتناوب؛ يُسمع صوت واحد فقط في أي لحظة”
- “تنهي سطرها، وقفة صمت، ثم يجيب”
- “بلا تداخل في الحوار؛ تبادل أدوار صارم”
وقفة صمت قصيرة بين الأسطر هي أيضًا أرخص طريقة لترك مساحة لردود الفعل. الحقول الطويلة تتدهور سريعًا — اقتصر الحوار على سطرين مسندَين كحد أقصى في المقطع، ودع لقطات رد الفعل تحمل الباقي.
برومبت مؤثرات الصوت: أفعال الصوت والتوقيت والاندماج
صوت يُطلق بعد إطارات قليلة من اصطدامه البصري يُقرأ كعطب، لا كنقص بسيط. لذلك ينقسم برومبت المؤثرات إلى نصفين: ما هو الصوت (المعجم) ومتى يُطلق (التوقيت).
معجم أفعال الصوت
أفعال الصوت قصيرة، مادية، وقابلة للتكرار — من اثنين إلى أربعة في المقطع، لا أكثر، وإلا انهار الخلط. المجموعة العملية:
| فعل الصوت | يُطلق عند | السجل |
|---|---|---|
crisp snap |
كسر، شق، قطع الساق، تقسيم البسكويت | حاد، انتقالي |
soft squish |
ضغط الكريمة والعجين والرغوة والهلام | منخفض، رطب |
metallic clink |
ملامسة أدوات وأغطية ومفاتيح ونقود | حاد، صغير |
ceramic tap |
وضع الأكواب والأطباق والبلاط | متوسط، مستدير |
wet pop |
قطرات، فقاعات، انفصال القشرة | متوسط، انتقال مستدير |
dull thud |
هبوط كيس وكتاب وأشياء برفق | منخفض، قصير |
sharp crack |
جليد، خشب جاف، قشور بيض | حاد، عدواني |
glass shatter |
نوافذ وزجاج وهشاشة تتحطم | حاد، ذيل ممتد |
fabric rustle |
ملابس وأسرّة وستائر | متوسط، شبيه بالضجيج |
paper crinkle |
أغلفة وصفقات وإيصالات | مرتفع، شبيه بالضجيج |
liquid pour |
تيارات وغرق وامتلاء | ممتد، متوسط |
keyboard clack |
كتابة ومفاتيح وأزرار | حاد، إيقاعي |
اقرن كل فعل بفاعله حتى لا يلصقه النموذج بالحدث الخاطئ: “طقطقة حادة كما ينكسر الشوكولاتة“، لا “طقطقة حادة” مجردة.
مزامنة التوقيت: “عند الاصطدام”
رموز التوقيت حروف جر للمزامنة. الحجر الأساس فيها “عند الاصطدام” — “ينزل الكوب مصحوبًا برطوبة سيراميك عند الاصطدام.” ابنِ معجمًا صغيرًا لما تبقى: “كما يُغلق الغطاء” لأفعال الإغلاق، “في اللحظة التي تلمسها الشفرة” للقطع، “متزامنًا مع القطعة” للصوت المدفوع بالمونتاج، “على الضربة القوية” للتوقيت الموسيقي (راجع رموز الإيقاع في دليل المقاطع القصيرة الفيروسية). ضع رموز التوقيت مباشرة بعد شرط الفعل — فهي ترتبط أقوى من الرموز المجموعة في فقرة “صوت” في نهاية البرومبت.
الصوت داخل الفضاء السردي مقابل خارجه
الصوت داخل الفضاء السردي ينبع من عالم المشهد — باب يُقفل لأن يدًا أغلقته. الصوت خارج الفضاء السردي يوجد للمشاهد فقط — صوت whoosh في دوران الكاميرا الحاد، وضربة جهير عميقة على بطاقة العنوان. كلاهما مشروع؛ والخلط بينهما هو ما يجعل المقاطع تبدو هاوية.
- أبقِ الصوت داخل الفضاء السردي: “جميع الأصوات تنبع من إجراءات مرئية داخل الإطار.”
- اطلب معالجة خارجية: “whoosh سينمائي خارج الفضاء السردي مع دوران الكاميرا الحاد.”
المونتاجات القصيرة عمومًا تريد مؤثرات سردية داخلية للنبضات القصصية وضربات خارجية فقط للانتقالات والعناوين. تكديس المؤثرات الخارجية فوق أجواء سردية كاملة هي أسرع طريقة لإغراق الخلط.
برومبت الأجواء: صوت الغرفة والطبقات البيئية ومبدأ الصمت
الأجواء هي الطبقة المستمرة — صوت فضاء موجود. غيابها يُحَس لا يُسمع: المقاطع بلا صوت غرفة تبدو مختومة بالفراغ، والمقطع بصوت غرفة خاطئ يشعر كأن المشهد نقل موقعه وسط اللقطة.
صوت الغرفة هو التوقيع شبه الصامت للمكان المغلق (“صوت غرفة هادئ، طنين خفيف لمكيّف الهواء”). الطبقات البيئية خارجية أو وضعية (“رياح بين الصنوبر،” “حركة طريق بعيدة تحت مطر خفيف”). هيّئ الأجواء كـ طبقة أساسية وحدثين بحد أقصى: أحداث بلا طبقة أساسية تبدو مرمية في فراغ؛ وطبقة أساسية بأحداث كثيرة تتحول إلى شريط مؤثرات. إن كانت الجغرافيا مهمة، سمِّ الطبقة مرة مبكرًا لتستمر عبر القطع: “طبقة المطر تعمل باستمرار تحت كل لقطة.”
مبدأ “الصمت خيار”
الصمت خيار، والنماذج لا تميّز خيارًا من إغفالًا. مسار صوتي غير مذكور لا يعود فارغًا — يعود بأي طبقة أساسية اعتبرها النموذج آمنة، والموسيقى منها الشائعة. اكتب الهدوء بوصفه محتوى:
- “بلا موسيقى؛ أجواء فقط”
- “صمت باستثناء [X]” — بتحديد الصوت الوحيد الذي يبقى
- “صوت غرفة شبه صامت، بلا موسيقى، وبلا مؤثرات تتجاوز قلب الصفحة”
النفي تعليمة من الدرجة الأولى: ما لا تريده، سمِّه ونفِه؛ وما تريده، سمِّه بفعل. يعرض دليلنا المرجعي متعدد الوسائط كيف يمكن لمرجعات الصوت أن تُثبّت شكل “الهدوء” بدل تركه للحظ.
مصفوفة دعم النماذج: سلوك الصوت وتطبيقاته على البرومبت
| النموذج | سلوك الصوت | الحالة الافتراضية | تطبيقات البرومبت |
|---|---|---|---|
| Veo 3.1 | صوت أصلي مفعّل دائمًا؛ حوار ومؤثرات وأجواء تُولَّد مع كل مقطع | الصوت حاضر دائمًا | كل برومبت هو موجز خلط. وجّه الطبقات الثلاث صراحةً، ونفِ ما لا تريده (“بلا موسيقى”)، وتوقّع أن تملأ الافتراضيات أي طبقة غير محددة. |
| Seedance 2.5 | صوت أصلي ثنائي اللغة مع مدخل مرجع صوتي | الصوت متاح؛ الأسلوب يُوجَّه بالمرجع | حدد اللغة لكل متحدث في كل مرة. عند توفير مرجع، يجب أن توافق جمل الصوت في البرومبت عليه — التناقضات تُحسم لصالح المرجع. |
| Kling 3.0 | قادر على الصوت الأصلي، معطّل افتراضيًا | صامت ما لم يُفعَّل الصوت | فعّل الصوت قبل التنفيذ؛ وإلا باتت جمل الصوت بلا أثر. وبعد تفعيله، تنطبق قواعد الحوار والمؤثرات والأجواء المعتادة. |
| Wan 3.0 | طبقة صوت مرفقة بالتوليد | فعّالة عند الطلب | عامل الصوت كمسار مستقل باسمه: “طبقة الصوت: حوار فوق طبقة مطر خفيف، بلا موسيقى” — تسمية الطبقة تمنع قراءة جمل الصوت كوصف بصري. |
تُستخلص من هذه المصفوفة عادتان عامتان. أولًا، شغّل مقطع فحص صوتي من سطر واحد قبل تنفيذ أي شيء طويل — “كوب سيراميك يوضع على طاولة خشبية، عند الاصطدام رطوبة سيراميك، طبقة غرفة هادئة، بلا موسيقى” — لتعرف من توليد واحد إن كان الصوت مفعّلًا أم مكتومًا أم يحتذى الموسيقى. ثانيًا، اكتب الهرمية الصوتية حتى حين تبدو بديهية، لأن التحمل يختلف لكل نموذج: سطر مهذاب على Kling (الصوت اختياري) هو حامل للأحمال على Veo (الصوت حتمي).
12 قالب برومبت حسب النية الصوتية
جميع القوالب تستهدف المقاطع القصيرة بنسبة 9:16 وتنقل بين النماذج الأربعة أعلاه. على Kling 3.0، فعّل الصوت أولًا؛ وعلى Veo 3.1، اعامل كل سطر صوتي كتوجيه إلزامي؛ وعلى Seedance 2.5، رموز اللغة تعمل فعليًا.
مشاهد حوارية (3)
القالب D-1 — حوار بتبادل الأدوار
Template: Two-Shot Turn-Taking Dialogue
Medium two-shot in a sunlit café booth. The woman in the red coat says,
"I can't believe you're actually leaving." A beat of silence, only her
face holding the reaction. The man looks down at his coffee and answers,
flat and quiet, "Neither can I." They speak one at a time — only one
voice is heard at any moment, no overlapping dialogue. Close-up on each
speaker as they deliver their line, lips in sync with the words.
Ambience: low café bed, faint cup clinks, no music. Vertical 9:16, 8 seconds.
القالب D-2 — لقطة قريبة لمتحدث واحد
Template: Direct-to-Camera Confession
Close-up of a young man in a dark hoodie against a plain concrete wall,
direct-to-camera delivery. He says, "Okay — so here's what nobody tells
you," spoken in English, tone urgent, leaning slightly into the lens.
Lips matched to the audio, shallow depth of field, single practical light
from the left. Audio: his voice clear and centered, faint hallway room
tone underneath, no music, no effects. Vertical 9:16, 6 seconds.
القالب D-3 — تعليق صوتي فوق الحركة
Template: Non-Diegetic Voiceover
Overhead shot of hands packing a suitcase on a bed. A calm female
voiceover (non-diegetic — no speaker on screen) says, "Three days, one
bag, no plan." Soft fabric rustle and zipper pull diegetic with the
action, held under the voice. Ambience: quiet bedroom room tone, no music.
Her tone is warm and unhurried; dialogue layer leads, SFX sits beneath it.
Vertical 9:16, 7 seconds.
مقاطع مدفوعة بمؤثرات الصوت (3)
القالب S-1 — سقوط منتج
Template: Product Drop on Impact
Slow-motion close-up of a matte-black wireless earbud case falling the
last six inches onto a concrete surface, bouncing once, settling. Camera
slightly below eye level, hard directional light raking across the
concrete. Audio: crisp snap on impact as the case lands, faint metallic
clink on the second bounce, scrape as it settles. Dry acoustic space, no
music, no ambience bed beyond a near-silent room floor. Vertical 9:16, 5 seconds.
القالب S-2 — إيقاع المطبخ
Template: Chopping Board SFX Sequence
Macro tracking shot along a wooden cutting board as a chef's knife
prepares vegetables: a crisp snap as a celery stalk breaks, sharp crack
on the carrot, soft squish as tomato slices fall aside. Each sound fires
on impact with the blade touching the board. Rhythmic, even pacing —
one cut per beat. Ambience: low kitchen bed, faint refrigerator hum,
no music. Vertical 9:16, 7 seconds.
القالب S-3 — فتح الصندوق بالصوت السردي فقط
Template: Diegetic-Only Unboxing
Top-down shot of hands opening a rigid product box on a linen surface.
Paper crinkle as the seal tears, dull thud as the lid is set down, soft
foam squeak as the device is lifted, ceramic tap as it is placed beside
the box. All sound diegetic — every sound originates from an action
visible in frame, no non-diegetic effects, no music. Quiet room tone bed.
Vertical 9:16, 8 seconds.
أجواء / ASMR (3)
القالب A-1 — نافذة المطر وخيار الصمت
Template: Rain Window Sleep Loop
Static shot of a rain-streaked window at night, city bokeh soft and
out of focus beyond the glass. Ambience: steady rain on glass as a
continuous bed, one distant thunder roll at the four-second mark, faint
room tone behind it. No music, no dialogue, no effects beyond the rain.
Quiet, slow, hypnotic pacing. Vertical 9:16, 10 seconds.
القالب A-2 — طبقة صباح الغابة
Template: Forest Ambience Bed
Slow push-in through a pine forest at dawn, low mist between trunks,
light shafts from the upper right. Ambience: soft wind in leaves as the
base bed, sparse far-off birdsong, one closer bird call at the midpoint.
No music, no dialogue, no human-made sound. Natural, unhurried pacing.
Vertical 9:16, 10 seconds.
القالب A-3 — قلب صفحة في شبه الصمت (ASMR)
Template: Near-Silence Page Turn
Macro close-up of a hardcover book open on a wool blanket, one page
turning in slow motion, fibres visible in the paper under warm
directional light. Audio: near-silence — soft room tone only — with a
single paper crinkle as the page lifts and a soft whisper of paper as it
settles. No music, no ambience bed beyond room tone, no dialogue.
Binaural feel for headphone playback. Vertical 9:16, 6 seconds.
متزامنة مع الموسيقى (3)
القالب M-1 — انتقال ملابس على ضربة الأصابع
Template: Beat-Synced Outfit Transition
Vertical hook: a woman stands in a hallway; on the downbeat of an upbeat
lo-fi track she snaps her fingers and the outfit transforms — three cuts
at 0.8-second intervals, each cut synchronized to a snare hit. Her snap
is a crisp diegetic transient layered over the music; footsteps and
fabric rustle sit low beneath the track. Music is the lead layer, SFX
secondary, no dialogue, thin street ambience bed. Vertical 9:16, 8 seconds.
القالب M-2 — مونتاج طبخ على الضربة القوية
Template: Percussive Cooking Montage
Fast-cut cooking montage: pan flip, herb sprinkle, plate landing —
each cut synchronized to the downbeat of a driving percussion track.
Diegetic kitchen SFX punctuate the rhythm: metallic clink of the pan,
liquid pour, ceramic tap as the plate lands, all on impact and locked
to the beat. Music leads the mix; SFX accent it; no dialogue; minimal
kitchen ambience under everything. Vertical 9:16, 9 seconds.
القالب M-3 — كشف سينمائي بالموسيقى فقط
Template: Music-Only Reveal
Wide drone shot rising over a foggy mountain ridge at sunrise, camera
crane-up revealing the valley. Audio: a single cinematic track — soft
strings swelling to a crescendo as the valley appears — with no
dialogue, no SFX, and only a faint wind bed mixed nearly to silence
underneath the music. Music layer leads completely; nothing competes
with the swell. Vertical 9:16, 10 seconds.
الأسئلة الشائعة
1. ماذا يعني “الصوت الأصلي” في توليد الفيديو بالذكاء الاصطناعي؟
الصوت الأصلي يعني أن النموذج يولّد مسار الصوت — الحوار ومؤثرات الصوت والأجواء — خلال الجولة نفسها التي يُنتج فيها الفيديو، وبتزامن جاهز. لا يُضاف شيء في ما بعد، لذا يصبح البرومبت موجز خلط صوتي: جمل الصوت التي تكتبها تصبح توجيهًا، والجمل التي تحذفها تصير إعدادات افتراضية للموديل.
2. ما زلت أحتاج تعليمات الصوت إن كان نموذجي يولّد الصوت دائمًا؟
نعم — أكثر من أي وقت مضى. على النماذج المفعّلة دائمًا مثل Veo 3.1، الصوت غير الموجّه لا يبقى صامتًا؛ بل يمتلئ بطبقة عامة ومؤثرات بنكهة جاهزة. جمل الصوت الصريحة تستبدل الخلط الافتراضي بخلط مقصود، والنفيات مثل “بلا موسيقى” تكبت الافتراضيات التي لا تريدها. دليل كتابة البرومبت الخاص بـ Veo يضم إشارات الصوت في بنيته القياسية لهذا السبب.
3. لماذا ينفذ أحد نماذجي نفس البرومبت بصمت؟
على الأرجح اختلاف في الحالة الافتراضية، لا خلل في البرومبت. Kling 3.0 يخرج فيديو صامتًا ما لم يُفعَّل الصوت — موثّقًا في دليل كتابة البرومبت لكل نموذج من Mstudio — بينما Veo 3.1 يرفق الصوت بكل توليد. شغّل مقطع فحص صوتي من سطر واحد على كل نموذج قبل تنفيذ المقاطع الطويلة، وأبقِ مفتاح الصوت لكل نموذج ضمن قائمة مهام سير عملك.
4. كيف أمنع شخصيتين من التحدث فوق بعضهما؟
اكتب تبادل الأدوار كتعليمات: “يتكلمان بالتناوب — يُسمع صوت واحد فقط في أي لحظة، بلا تداخل في الحوار.” أسند كل سطر إلى متحدث محدد، وأدرج وقفة صمت بين الأسطر، واحصر المقطع بسطرين مسندَين. التداخل هو الافتراضي الإحصائي لـ”شخصين يتحدثان”، لذا يجب فرض تخطيه هيكليًا.
5. كيف أحدد اللغة التي تتحدثها الشخصيات؟
اذكر اللغة داخل شرط الكلام، لكل متحدث: “تقول: ‘[السطر]’ — منطوقة بالصينية.” لا تعتمد على أسماء الشخصيات أو المكان أو النص على الشاشة لاستنتاج اللغة. النماذج القادرة على ثنائية اللغة مثل Seedance 2.5 تحترم رموز اللغة الصريحة؛ وفي غيرها، يمنح الرمز النموذج على الأقل هدفًا متسقًا بدل التخمين.
6. ما الفرق بين مؤثرات الصوت داخل الفضاء السردي وخارجه؟
المؤثرات الداخلية تنبع من مصادر داخل المشهد — باب يُقفل لأن يدًا أغلقته. المؤثرات الخارجية وجودها للمشاهد فقط — صوت whoosh في دوران الكاميرا الحاد، وضربة على بطاقة العنوان. أبقِ المؤثرات السردية داخلية، واحجز الضربات الخارجية للانتقالات والعناوين، وصرّح بها حين تهم: “جميع الأصوات تنبع من إجراءات مرئية داخل الإطار.”
7. مقطعي ينبغي أن يكون هادئًا — فلماذا يعود بالموسيقى؟
لأن الصمت خيار لا تستطيع النماذج استنتاجه من الإغفال؛ والمسار الصوتي غير المذكور يحصل على افتراضي آمن، والموسيقى منه الشائع. اكتب الهدوء صراحة: “بلا موسيقى؛ أجواء فقط”، أو “صوت غرفة شبه صامت باستثناء قلب الصفحة.” النفي تعليمة برومبت من الدرجة الأولى.
الخاتمة
الصوت الأصلي حوّل كل برومبت فيديو إلى موجز خلط. جعلت النماذج مسار الصوت أمرًا حتميًا — مفعّلًا دائمًا على Veo 3.1، ثنائي اللغة وموجّهًا بالمرجع على Seedance 2.5، اختياريًا على Kling 3.0، مطبقًا كطبقة على Wan 3.0 — ومهمة صانع المحتوى هي توجيه الطبقات الثلاث بدل ترك الافتراضيات تملؤها. تُختزل التقنية في قائمة تدقيق: أسند كل سطر وأفرض تبادل الأدوار في الحوار؛ اربط أفعال الصوت بفاعليها وأطلقها “عند الاصطدام” في المؤثرات؛ حدد طبقة أساسية مع حدثين في الأجواء؛ واكتب “بلا موسيقى” كلما قصدت الهدوء. على النماذج المعطّلة افتراضيًا، اقلب المفتاح أولًا — وإلا صُمّت أفضل جمل صوت في العالم.
ابدأ بمقطع الفحص، واختر القالب الموافق لنيتك الصوتية، وعدّل طبقة واحدة في كل مرة. لممارسة أعمق: التعمق في الصوت الأصلي على Veo 3.1 يغطي الصوت المفعّل دائمًا؛ ودليل برومبتات Seedance 2.5 يغطي المخرجات ثنائية اللغة ومرجعات الصوت؛ ومكتبة القوالب بأسلوب ASMR توسّع قسمي المؤثرات والأجواء؛ ودليل المقاطع القصيرة الفيروسية يغطي رموز توقيت الإيقاع؛ ودليل المرجع متعدد الوسائط يعرض الصوت كمدخل لا كمخرج فقط.
تمت المراجعة من قبل فريق تحرير videosprompt.org · أكتوبر 2026
مشاركة المقال