دليل MiniMax H3 Prompt: الإطار الكامل للتوجيه لفيديو 2K مع صوت أصلي (2026)
وصف ميتا: إتقان توجيه MiniMax H3 باستخدام الصيغة الرسمية المكوّنة من 6 كتل، 25 قالب جاهز للنسخ، وتقنيات الخبراء للنص إلى فيديو، الصورة إلى فيديو، والمرجع إلى فيديو. يشمل الكاميرا، الصوت، اللقطات المتعددة، وحل المشكلات. محدث لـ H3 و H3 Max.
الكلمة المفتاحية المستهدفة: minimax h3 prompt guide الكلمات المفتاحية الثانوية: minimax h3 prompting guide, minimax h3 prompt, minimax prompt guide, hailuo 3.0 prompt, mini max h3 video prompt, h3 prompt formula
MiniMax H3 لا يعمل مثل نماذج الفيديو الأخرى. رمي كومة من الصفات على Sora سيعطيك شيئًا جميلًا. رمي نفس الكومة على H3 سيعطيك إطارًا مشوشًا لا يستطيع أن يقرر ما سيحركه.
H3 هو نموذج المخرج. يقرأ توجيهك كقائمة لقطات زمنية: ما هو في الإطار الافتتاحي، ما يتحرك، كيف تتصرف الكاميرا، ما هو الصوت، وما هو شكل الإطار النهائي. إذا نجحت في ذلك، يكافئك H3 بفيديو 2K، صوت ستيريو أصلي، وفيزياء حركة منطقية.
إذا أخطأت، ستحرق الاعتمادات.
هذا الدليل هو المرجع النهائي لتوجيه MiniMax H3 — يغطي كل وضعية توليد (نص إلى فيديو، صورة إلى فيديو، إطار أول وآخر، والمرجع إلى فيديو)، هيكل التوجيه الرسمي، مفردات الكاميرا والصوت، 25 قالب جاهز للنسخ، وقسم حل المشكلات الذي يصلح أكثر الأخطاء شيوعًا.
سواء كنت تستخدم H3 على fal.ai، C Dance AI، ComfyUI، أو منصة MiniMax مباشرةً، فإن هذا الدليل ينطبق.
جدول المحتويات
- ما الذي يجعل MiniMax H3 مختلفًا
- صيغة توجيه H3 المكوّنة من 6 كتل
- التوجيه حسب الوضعية: T2V vs I2V vs FL2V vs Ref2V
- مرجع حركة الكاميرا لـ H3
- توجيه الصوت: الحوار، الضوضاء، والموسيقى
- توجيه اللقطات المتعددة مع H3
- 25 قالب جاهز للنسخ لتوجيه MiniMax H3
- حل المشكلات: عندما يتجاهل H3 توجيهك
- H3 مقابل المنافسين: اختلافات نمط التوجيه
- مقارنة إصدارات MiniMax H3
- الأسئلة المتكررة: توجيه MiniMax H3
- الخاتمة
ما الذي يجعل MiniMax H3 مختلفًا
MiniMax H3 (المعروف أيضًا باسم Hailuo 3.0) هو نموذج الفيديو المتعدد الوسائط من الجيل التالي من MiniMax. تم إصداره بأوزان مفتوحة في يوليو 2026، وصُمم كنموذج متعدد الوسائط عام بدلاً من مجموعة نماذج مهام منفصلة.
القدرات الأساسية
- إخراج بدقة 2K (1440 بكسل على الحافة القصيرة)
- من 5 إلى 15 ثانية لكل توليد بسرعة 24 إطارًا في الثانية
- صوت ستيريو أصلي — حوار، ضوضاء، مؤثرات، وموسيقى تُولَّد مع الفيديو
- إدخال متعدد الوسائط — نص، صور، فيديو، وصوت جميعًا في سياق واحد
- المرجع إلى فيديو — حتى 9 صور، 3 مقاطع فيديو، و3 مقاطع صوتية (مجموع 12 ملفًا)
- إظهار نص واضح — واجهات المستخدم، ترجمات، عناصر العلامة التجارية، ولافتات
- أوزان مفتوحة — يعمل محليًا على بطاقات الرسوميات الاسته ( (RTX 3060+)
ما يبرع فيه H3
كما يذكر دليل توجيه H3 في fal.ai: “هو قوي في ثلاثة أمور خاصة: قراءة مراجع متعددة في آن واحد، إظهار نص واضح وواجهات، وإجراء تعديلات محلية دقيقة على الفيديو الذي لديك بالفعل.”
هذا يجعل H3 مناسبًا بشكل فريد لـ:
- الإنتاج التجاري — إعلانات منتجات مع نصوص فوق الفيديو وعناصر علامة تجارية
- السرد القائم على الشخصيات — شخصيات ثابتة الهوية عبر اللقطات
- المحتوى السمعي البصري — مشاهد حوار، فيديوهات موسيقية، ASMR
- سير العمل المتعدد المراجع — دمج مراجع الوجه، الجسد، البيئة، والأسلوب
أين يختلف H3 عن النماذج الأخرى
| الجانب | MiniMax H3 | Kling 3.0 | Seedance 2.0 | Sora 2 |
|---|---|---|---|---|
| نمط التوجيه | قائمة لقطات زمنية | صيغة مكوّنة من 4 أجزاء | صيغة مكوّنة من 6 كتل | سرد وصفي |
| صوت أصلي | ✅ ستيريو | ✅ نعم | ✅ نعم | ✅ نعم |
| أقصى دقة | 2K | 1080p | 1080p | 1080p |
| أقصى مدة | 15 ثانية | 15 ثانية | 15 ثانية | ~25 ثانية |
| مداخل المراجع | 9 صور + 3 فيديو + 3 صوت | متعدد الصور | متعدد الصور | محدودة |
| إظهار النص | ✅ ممتاز | ⚠️ متوسط | ⚠️ متوسط | ⚠️ متوسط |
| أوزان مفتوحة | ✅ نعم | ❌ لا | ❌ لا | ❌ لا |
صيغة توجيه H3 المكوّنة من 6 كتل
تعمل توجيهات MiniMax H3 بأفضل شكل عندما تُكتب كـ جدول زمني. حدد الإطار الافتتاحي، الفعل المرئي، مسار الكاميرا، الصوت، والحالة النهائية — بهذا الترتيب.
[الإطار الافتتاحي] + [فعل الموضوع] + [استجابة البيئة] + [مسار الكاميرا] + [الصوت] + [الإطار النهائي]
الكتلة 1: الإطار الافتتاحي
ما هو داخل الإطار قبل أن يتحرك شيء؟ حدد الموضوع، الموقع، الخلفية، والإضاءة.
نص إلى فيديو: يجب أن تبني الإطار الافتتاحي بالكامل من الصفر. صورة إلى فيديو: الصورة هي الإطار الافتتاحي. لا تُعيد وصفها. المرجع إلى فيديو: حدد ما يتحكم به كل مرجع.
الكتلة 2: فعل الموضوع
فعل أساسي واحد. صف السبب والنتيجة، ليس الفعل فقط.
- ❌ “الرياح تهب” → غامض
- ✅ “وشاحها يرفرف ويتبعها” → فيزيائي دقيق
الكتلة 3: استجابة البيئة
كيف تتفاعل البيئة مع الفعل؟ أمطار على الأسطح، غبار يرتفع، قماش يتحرك، انعكاسات تتغير.
الكتلة 4: مسار الكاميرا
حركة كاميرا أساسية واحدة. H3 يفهم: الاقتراب، الابتعاد، التحريك الأفقي، الميل، المتابعة، الدوران، الثبات، الرافعة، وغيرها.
الكتلة 5: الصوت
H3 يولد صوت ستيريو أصلي. قسّم صوتك إلى طبقات:
- الحوار: السطور الدقيقة مع تسمية المتحدث
- الضوضاء: أصوات البيئة
- المؤثرات: أصوات مادية (خطوات، اصطدامات، قماش)
- الموسيقى: مقطوعة خلفية (حدد النوع، المزاج، الآلات)
الكتلة 6: الإطار النهائي
ما الذي يظهر في الإطار الأخير؟ هذا يثبت الحالة النهائية ويمنع الانحراف.
مثال على توجيه
فيديو إعلاني للمنتج في استوديو حقيقي. علبة صودا سيترالية باردة تقف
مستقيمة على سطح حجري داكن. تدفق ضيق من الماء
يضرب السطح بجوار العلبة، يتقلب الرذاذ حول القاعدة،
والتكثف يتساقط على المعدن. تدور الكاميرا ببطء
معclock الساعة لتواجه العدسة. إضاءة حادة،
انعكاسات محدودة. ينتهي المشهد بالماء المستقر
والعلبة في الوسط.
هذا التوجيه يحدد الإطار الافتتاحي (العلبة على الحجر)، الفعل (ضربة الماء والرذاذ)، استجابة البيئة (تكثف، رذاذ متقلب)، الكاميرا (دوران ببطء)، الصوت (أصوات ماء ضمنية)، والإطار النهائي (الماء مستقر، العلبة في الوسط).
التوجيه حسب الوضعية: T2V vs I2V vs FL2V vs Ref2V
يدعم H3 أربعة أوضاع توليد. كل وضع يتطلب سلوك توجيه مختلف.
نص إلى فيديو (T2V)
بدون وسائط مصدر. تحدد كل شيء من الصفر.
يجب أن يتضمن التوجيه: وصف كامل للإطار الافتتاحي (الموضوع، الموقع، الخلفية، الإضاءة)، الفعل، الكاميرا، الصوت، والحالة النهائية.
خطأ شائع: البدء بالفعل قبل تحديد المشهد. يحتاج H3 إلى معرفة ما موجود قبل أن يتم تحريكه.
امرأة بمعطف أحمر تقف على حافة رصيف ضبابي في
الفجر. تخطو خطوة بطيئة إلى الأمام، يتمايل معطفها. الكاميرا
تتبعها على مستوى الخصر. الضباب ينساب فوق الماء.
طيور النورس في المسافة. تتوقف عند نهاية الرصيف
وتنظر إلى الخارج. لا موسيقى، فقط ضوضاء خلفية.
صورة إلى فيديو (I2V)
حمّل صورة كالإطار الافتتاحي. تحدد الصورة المظهر؛ يحدد توجيهك الحركة.
يجب أن لا: تعيد وصف ما تُظهره الصورة بالفعل. يجب أن: تصف ما يحدث بعد الإطار الأول.
استخدام الصورة المحمّلة كالإطار الافتتاحي الدقيق. احفظ
وجه المرأة، سترة الصوف الزرقاء، العقد الفضي، موضع
المقعد، وتخطيط عربة القطار. ترفع نظرها من
رسالة مطوية، تنظر إلى النافذة الممطرة، ثم
تطوي الورقة على الطية الموجودة. الكاميرا تتبع ببطء
إلى اليمين بينما ينعكس انعكاسها في الزجاج. المطر يطرق
النافذة، متجاوزًا إيقاع عجلات القطار الهادئ. لا
موسيقى خلفية.
إطار أول وآخر (FL2V)
حمّل كلًا نهائيًا صورة. يولد H3 الحركة بينهما.
يجب أن: تصف الانتقال الفيزيائي بين الإطارات — كيف يتغير الوضع، الأشياء، الكاميرا، والإضاءة من البداية إلى النهاية.
خطأ شائع: وصف صورتين ثابتتين. يحتاج H3 إلى المسار بينهما.
يرتفع الموضوع من الكرسي، يخطو ثلاث خطوات نحو
النافذة، ويدير وجهه نحو الكاميرا. الكاميرا تبتعد
من لقطة متوسطة إلى لقطة واسعة. الإضاءة تتحول من
الداخل الدافئ إلى ضوء النافذة البارد أثناء حركته. ينتقل
الضوضاء الغرفة إلى أصوات الشارع من النافذة.
مرجع إلى فيديو (Ref2V)
حمّل مراجع متعددة (صور، فيديو، صوت) وعيّن لكل منها دورًا محددًا.
يجب أن: تذكر صراحة ما يتحكم به كل مرجع.
@Image1 يحدد وجه الشخصية وشعرها.
@Image2 يحدد ملابسها ولوحة ألوانها.
@Video1 يزود بحركة الجسد وإيقاع الكاميرا.
@Audio1 يزود بتوقيت الصوت.
استخدم شخص @Image1 كالمؤدي الوحيد. احفظ
نسب وجهها، شعرها الأسود القصير، ومعطفها الأحمر من
@Image1. اتبع حركة الجسد وإيقاع اللقطات من @Video1،
لكن ضع الفعل في منصة المترو المعروضة في @Image2.
احتفظ بمسار الكاميرا وتتابع وضعية المؤدي من @Video1.
استخدم @Audio1 للتوقيت؛ لا تضف موسيقى خلفية.
قاعدة أساسية: المراجع المتضاربة تُسبب انحرافًا. إذا أظهرت صورتان ملابس أو أشكال وجه مختلفة، يجب على H3 أن يخمن ما يبقى. احذف المرجع الأضعف قبل إضافة نص توجيه إضافي.
مرجع حركة الكاميرا لـ H3
يفهم H3 أفعال الكاميرا المحددة. استخدمها بدقة.
| الحركة | عبارة التوجيه | الأنسب لـ |
|---|---|---|
| الاقتراب | “تدفع الكاميرا ببطء نحو [الموضوع]” | كشف، توتر، تأكيد |
| الابتعاد | “تبتعد الكاميرا ببطء لتظهر [المشهد]” | وضع السياق |
| التحريك الأفقي | “تتحرك الكاميرا [الاتجاه] عبر المشهد” | كشف أفقي |
| الميل | “تميل الكاميرا [الاتجاه]” | كشف عمودي |
| المتابعة | “تتبع الكاميرا [الموضوع]” | مشاهد المشي، سلاسل حركية |
| الدوران | “تدور الكاميرا حول [الموضوع]” | مشاهد 360 درجة |
| الثبات | “تبقى الكاميرا ثابتة ومقفلة” | لقطات المنتج، رؤوس المتحدث |
| الرافعة | “ترفع/تنزل الرافعة الكاميرا” | تحولات عمودية دراماتيكية |
| يدوي | “حركة يدوية خفيفة” | وثائقي، إحساس أصيل |
| حركة سريعة | “تحريك سريع للكاميرا نحو [الموضوع]” | انتقالات، طاقة |
| تقريب | “تقريب بطيء على [التفصيل]” | تأكيد التفاصيل |
نصائح خاصة بـ H3:
- استخدم حركة كاميرا أساسية واحدة لكل لقطة. تكديس الحركات (“دوران + تقريب + حركة سريعة”) يزعزع النتيجة.
- اكتب الكاميرا كـ تعليمات مشهد، لا كقائمة علامات: “تتبع الكاميرا المتساق أفضل أفضل من “لقطة تتبع، كاميرا ديناميكية.”
- للكشف، صف المنظر الابتدائي، الحركة، وما يُكشف: “تبدأ اللقطة القريبة على يدي الخباز. ببطء تبتعد الكاميرا لتظهر طاولة العمل بالكامل.”
توجيه الصوت: الحوار، الضوضاء، والموسيقى
يولد H3 صوت ستيريو أصلي مع الفيديو. قسّم صوتك إلى ثلاث طبقات متميزة:
الطبقة 1: الحوار
ضع السطور الدقيقة بين علامات الاقتباس. سمّ المتحدث. حدد اللغة والنبرة.
[المتحدث 1: امرأة، صوت دافئ، الإنجليزية]: "كنت أنتظر
هذه اللحظة."
[المتحدث 2: رجل، نبرة هادئة، الإنجليزية]: "وأنا كذلك."
نصائح:
- اجعل السطور قصيرة. احسب توقيتها بصوت عالٍ — إذا استغرقت جملة 5 ثوانٍ، لن تتناسب طبيعيًا مع مقطع مدته 6 ثوانٍ مع الفعل.
- حدد “تحرك شفاههم فقط أثناء سطورهم” لتجنب التزامن الخاطئ.
- بالنسبة للتعليق الصوتي، اذكر أنه خارج الشاشة وأن شفاه الشخصية على الشاشة تبقى مغلقة.
الطبقة 2: الضوضاء والمؤثرات
اسم المصدر، التوقيت، ومستوى الصوت للأصوات المادية.
صوت: ضوضاء عجلات ثابتة، مطر خفيف على الزجاج، صوت
طباعة التذاكر. خطوات على الحصى. باب يئن
عند الفتح. حراك القماش في الرياح.
الطبقة 3: الموسيقى الخلفية
صف النوع، المزاج، الآلات، ومتى تدخل/تخرج.
موسيقى خلفية: نغمات بيانو خفيفة بإيقاع بطيء، تتلاشى
بعد أن يتحدث الشخصية، تتصاعد بلطف نحو النهاية.
أو الصمت:
لا موسيقى خلفية. فقط ضوضاء محيطة.
توجيه اللقطات المتعددة مع H3
يدعم H3 توليد لقطات متعددة داخل توجيه واحد. استخدم علامات [Shot N] وتقطيعًا قائمًا على الطوابع الزمنية.
الصيغة
[Shot 1] وصف اللقطة الافتتاحية. المدة والفعل.
[Shot 2] عند 00:03.000، انتقل إلى اللقطة التالية. الوصف.
[Shot 3] عند 00:07.000، انتقل إلى اللقطة النهائية. الوصف.
مثال: إعلان منتج لمدة 10 ثوانٍ (3 لقطات)
[Shot 1] إعلان حقيقي، لقطة مقربة شديدة للعداء يربط
حذائه على مسار مبلل عند الفجر. الكاميرا منخفضة وثابتة.
القماش يت Tight، الحذاء يتشدد. 3 ثوانٍ.
[Shot 2] عند 00:03.000، انتقل إلى لقطة جانبية متتبعة بينما
يتسارع العداء عبر المنحنى الأول. كل خطوة تُنثر
رشًا صغيرًا من المسار. التنفس وتأثيرات القدم
تغلب الضوضاء البعيدة للمدينة. 4 ثوانٍ.
[Shot 3] عند 00:07.000، انتقل إلى الحذاء يهبط بجوار
خط النهاية، ثم تقريب بطيء بينما يتوقف العداء. نبضة
إيقاعية قصيرة تنتهي مع آخر خطوة. 3 ثوانٍ.
أفضل الممارسات للقطات المتعددة
- خصص الوقت بوعي — 3 ثوانٍ للإعداد، 4 ثوانٍ للفعل، 3 ثوانٍ للختام
- اجعل كل لقطة بسيطة — فعل واحد، حركة كاميرا واحدة لكل لقطة
- استخدم الطوابع الزمنية للانتقالات، وليس للقطات المستمرة
- حافظ على الهوية — أعد استخدام أوصاف الشخصيات الدقيقة عبر اللقطات
- استمرارية الصوت — صف كيف ينتقل الصوت بين اللقطات
- لا تُطبع طابعقة مستمرة — استخدم الطوابع الزمنية فقط للانتقالات بين اللقطات
25 قالب جاهز للنسخ لتوجيه MiniMax H3
المنتج والإعلانات (5 قوالب)
1. بطل المنتج مع سائل
فيديو إعلاني للمنتج في استوديو حقيقي. [المنتج] يقف على
[سطح]. تدفق ضيق من [السائل] يضرب السطح
بجانبها، يتقلب الرذاذ حول القاعدة. تدور الكاميرا
ببطء مع clockwise مع وضع العلامة أمام العدسة. إضاءة حادة،
انعكاسات محدودة. ينتهي المشهد بالماء المستقر
والمنتج في الوسط.
2. كشف المنتج
[Shot 1] لقطة مقربة لصندوق يحمل علامة تجارية على سطح داكن.
تفتح الأيدي الغطاء ببطء، كاشفةً [المنتج] داخل الصندوق.
إضاءة علوية ناعمة تملأ الصندوق. 4 ثوانٍ.
[Shot 2] تبتعد الكاميرا ببطء لتظهر المنتج بالكامل.
ترفع الأيدي المنتج وتديره نحو الكاميرا. إضاءة استوديو نظيفة. 6 ثوانٍ.
3. إعلان بنص متحرك
إعلان منتج حقيقي. [المنتج] على [سطح].
نص متحرك "[نص العلامة]" ينزلق من الأسفل ويثبت
في موضعه مع ارتداد خفيف. الكاميرا ثابتة. تصميم
حديث نظيف. نمط رسومات متحركة. لا تشويه للنص.
4. تفاصيل ماكرو للساعة الفاخرة
ماكرو مكثف لوجه ساعة فاخرة على رخام داكن. يدور
العقرب الثواني بسلاسة. إضاءة دقيقة من الأعلى
تلتقط الإطار المصقول. تدفع الكاميرا ببطء نحو
مركز القرص. صوت تيك-توك، لا موسيقى. 8 ثوانٍ.
5. دوران المجوهرات
خاتم ماسي على قاعدة مخملية سوداء يدور ببطء
على طاولة دوارة. إضاءة صلبة من اليمين العلوي
تلتقط كل وجه. كاميرا ثابتة مقربة. لوحة ألوان
سوداء عميقة وبيضاء باردة. 7 ثوانٍ.
الشخصيات والحوار (5 قوالب)
6. مشي الشخصية (فيزيائي دقيق)
لقطة تتبع منخفضة عند مستوى الشارع. [وصف الشخصية]
تمشي عبر [الموقع]. إيقاع ثابت. كل خطوة
تضرب الكعب أولاً، تتدحرج إلى الأمام مع وزن واضح.
[السطح] ينعكس [الإضاءة]. فيلم 35 مم، عمق ميدان ضحل.
ضوضاء [الصوت] المحيطة.
7. حوار شخصين
[Shot 1] لقطة متوسطة مقربة لـ [الشخص أ] يواجه الكاميرا.
[الشخص أ: وصف، صوت]: "[الحوار]." إضاءة طبيعية. 4 ثوانٍ.
[Shot 2] انتقل إلى [الشخص ب] يرد.
[الشخص ب: وصف، صوت]: "[الحوار]." نفس إعداد الإضاءة. 4 ثوانٍ.
8. مقربة عاطفية
ماكرو مكثف لوجه [الشخص]. [العاطفة] تجتاح
ملامحه ببطء — العيون تلين، الكتفين تنخفضان قليلاً.
إضاءة صلبة من [الاتجاه]. عمق ميدان ضحل. حميم،
ضعيف. لا تشويه للوجه. 6 ثوانٍ.
9. تفاعل الشخصية مع جسم
[الشخص] يمد يده ويلتقط [الجسم] من [السطح].
تلتف الأصابع حوله بإمساك طبيعي. تدفع الكاميرا ببطء.
[الإضاءة]. نمط سينمائي. لا تشويه لليد،
لا تشويه للجسم. 6 ثوانٍ.
10. شخصية مع الرياح
[الشخص] يقف في [الموقع]. رياح خفيفة من [اليمين]
ترفع وتدفق [الشعر/الملابس] بشكل طبيعي.
لقطة ثابتة متوسطة. إضاءة غروب الشمس. سينمائي.
لا دمج للشعر، لا تشويه للوجه. 6 ثوانٍ.
المحتوى المولد من قبل المستخدم ووسائل التواصل (5 قوالب)
11. رأس مبدع يتحدث
فيديو عمودي من الهاتف. المبدع يواجه الكاميرا في غرفة مضيئة.
"[سطر الجذب]" بنبرة حماسية وصادقة. ضوء نافذة طبيعي.
حركة يدوية خفيفة. إيقاع موجه لوسائل التواصل.
لا تشويه للوجه. 8 ثوانٍ.
12. فتح الصندوق
لقطة من الأعلى. الأيدي تفتح صندوقًا يحمل علامة تجارية على طاولة،
تلتقط [المنتج] وتديره لعرضه للكاميرا. إضاءة داخلية طبيعية.
نمط UGC. "انظر ما وصل للتو" همس متحمس. لا تقاطع لليد. 8 ثوانٍ.
13. كشف ما قبل/بعد
[Shot 1] [الحالة قبل]. كاميرا ثابتة. خلفية نظيفة.
3 ثوانٍ.
[Shot 2] قطع سريع إلى [الحالة بعد]. نفس الإطار. إضاءة استوديو ساطعة. لحظة تحول مرضية. 4 ثوانٍ.
14. عرض المنتج
المبدع يمسك [المنتج] أمام الكاميرا. يوضح [الميزة]
بحركة يد طبيعية. "[سطر عرض المنتج]" بنبرة
واثقة ومفيدة. إضاءة استوديو دافئة. إيقاع موجه لوسائل التواصل.
لا تشويه لليد. 10 ثوانٍ.
15. تحريك تخطيط مسطح
لقطة من الأعلى لترتيب مسطح مصمم. عنصر واحد
ينزلق ببطء إلى الإطار من الحافة ويستقر في موضعه.
كاميرا ثابتة. ضوء نهاري ناعم ومتساوي. نمط تحريري.
لا تداخل بين العناصر. 6 ثوانٍ.
السينمائي والطبيعة (5 قوالب)
16. لقطة تمهيدية
لقطة تمهيدية واسعة لـ [الموقع] في [وقت اليوم].
[عنصر جوي] ينجرف عبر المشهد. الكاميرا
ترفع ببطء لتكشف عن الحجم الكامل. لوحة ألوان
سينمائية، ضوء حجمي. ضوضاء [الصوت]، لا حوار.
10 ثوانٍ.
17. مشهد عاصفة
[Shot 1] لقطة واسعة لـ [الموقع] مع اقتراب العاصفة.
سماء داكنة، رياح تشتد. 4 ثوانٍ.
[Shot 2] يبدأ المطر، وإضاءة البرق تضيء المشهد.
كاميرا ثابتة. رعد عميق. 4 ثوانٍ.
[Shot 3] هطول غزير. تدفع الكاميرا ببطء نحو [الموضوع].
مطر على الأسطح. 4 ثوانٍ.
18. منظر طبيعي في ساعة الذهبية
لقطة واسعة لـ [المنظر] في الساعة الذهبية. ظلال طويلة
تمتد عبر التضاريس. شمس منخفضة دافئة. ترفع الكاميرا ببطء
لكشف عن المشهد الكامل. رياح خفيفة تحرك النباتات.
صوت طبيعي محيطي. لا موسيقى. 10 ثوانٍ.
19. المشي في غابة ضبابية
لقطة متوسطة واسعة تتحرك ببطء عبر غابة كثيفة في
الفجر. ضباب كثيف ينجرف بين الأشجار. أشعة ضوء حجمي
تخترق القبة. الكاميرا تتبع إلى الأمام بسرعة المشي.
لوحة ألوان خضراء ورمادية هادئة. أصوات غابة ناعمة.
10 ثوانٍ.
20. مشهد تحت الماء
لقطة واسعة تحت الماء. [الموضوع] يتحرك عبر الماء
بطفو طبيعي. ضوء متقاطع من السطح يخلق
تجسيمات ضوء متحركة. الكاميرا تتبع ببطء.
إيقاع أحلامي. صوت مائي محيطي. 8 ثوانٍ.
الطعام والمشروبات (5 قوالب)
21. صب القهوة
لقطة مقربة لفنجان سيراميك على سطح خشبي. صب القهوة
من الأعلى في تدفق سلس، يملأ الفنجان. يتصاعد البخار
ببطء. تدفع الكاميرا ببطء. إضاءة مقهى دافئة، خلفية
بوكيه ناعمة. أصوات مقهى. 6 ثوانٍ.
22. طبق ي sizzling
لقطة من الأعلى مقربة لـ [الطبق] على صينية ساخنة. [المكون]
يصدر صوت سطخ وتفرقعات. يتصاعد البخار. تدفع الكاميرا ببطء.
إضاءة مطبخ دافئة. صوت الطهي، لا موسيقى. 6 ثوانٍ.
23. تجميع كوكتيل
لقطة مقربة لكوب على سطح بار. [السائل] يصب
على الثلج بحركة بطيئة. يصدّ الثلج ويتحرك. تدور الكاميرا ببطء.
إضاءة بار درامية. صوت السائل، رنين الثلج.
لا تشويه للسائل. 7 ثوانٍ.
24. تحضير مكوّن
لقطة مقربة ليدين تقطّع [المكوّن] على لوحة تقطيع خشبية.
كل قطع دقيقة وإيقاعية. زاوية من الأعلى.
إضاءة مطبخ طبيعية ساطعة. صوت سكين على الخشب.
لا تشويه لليد. 6 ثوانٍ.
25. كسر الشوكولاتة
لقطة مقربة لشريط شوكولاتة. يد تزيل ببطء قطعة،
كاشفةً المقطع المتقاطع. تنفصل القطعة
بصوت طقطقة مُرضٍ. كاميرا ثابتة ماكرو. إضاءة استوديو دافئة.
صوت طقطقة، لا موسيقى. 5 ثوانٍ.
لمزيد من توجيهات H3 المختبرة مع مخرجاتها، تصفح مجتمع VideosPrompt الذي يضم توجيهات منظمة حسب النموذج والفئة.
حل المشكلات: عندما يتجاهل H3 توجيهك
عند فشل الإخراج، غيّر التعليمات الأدنى التي تشرح الفشل. لا تعيد كتابة التوجيه بالكامل.
| الفشل | السبب المحتمل | أول تعديل |
|---|---|---|
| قطع عشوائي | حركات كاميرا متعددة أو تغييرات مشهد متنافسة | اطلب لقطة مستمرة واحدة، مسار كاميرا واحد |
| شخص غير صحيح يتحدث | عدم استقرار تعريف المتحدث | امنح كل متحدث تسمية ثابتة، اختصر الحوار |
| الحوار يبدو متسرعًا | سطور طويلة جدًا للمدة | احسب توقيت السطور بصوت عالٍ، أو زد مدة المقطع |
| تشويه المنتج | الكثير من الحركات، الكاميرا، وعناصر النمط | ثبت وضعية المنتج، احذف الحركة الثانوية |
| انحراف هوية المرجع | مراجع متضاربة أو شخصية غير واضحة | احتفظ بأوضح صورة هوية، صرح بالشخصيات المتبقية صوح عدم اتصال بين الإطارين |
| صوت غير مرتبط | وصف الصوت كجو فقط | اسم المصدر، التوقيت، وتغيّر المستوى |
| تجاهل الكاميرا | تعليمات الكاميرا مضمونة في الوصف | ضع تعليمات الكاميرا في جملة منفصلة، مبكرة في التوجيه |
| عدم اتساق النمط | أوصاف نمطية متضاربة | استخدم تسمية نمط واحدة: “سينمائي” أو “وثائقي”، لا كليهما |
المبدأ الأساسي: إذا كان الكاميرا خاطئة لكن الموضوع صحيح، احتفظ بلغة الموضوع وعدّل فقط جملة الكاميرا. كل محاولة إعادة يجب أن تغيّر متغيرًا واحدًا.
H3 مقابل المنافسين: اختلافات نمط التوجيه
نفس الفكرة تحتاج إلى لغة توجيه مختلفة لكل نموذج:
نفس المشهد، أربع لهجات
الفكرة: امرأة تمشي في زقاق مبلل بالمطر ليلًا.
MiniMax H3:
لقطة سينمائية حقيقية. امرأة بمعطف داكن تمشي
في زقاق مبلل بالمطر ليلًا. إيقاع ثابت، كل خطوة
تُحدث رذاذًا في البرك. الكاميرا تتبعها على مستوى
الخصر. انعكاسات نيون على الرصيف المبلل. مطر
محيط، مرور سيارات بعيد. تتوقف عند نهاية الزقاق
وتنظر إلى الأعلى. لا موسيقى.
Kling 3.0:
لقطة تتبع متوسطة. امرأة بمعطف داكن تمشي
في زقاق مبلل بالمطر ليلًا. إيقاع ثابت، رذاذ في البرك.
انعكاسات نيون على الرصيف المبلل. فيلم 35 مم، عمق ميدان ضحل.
مطر محيط، مرور سيارات بعيد.
Seedance 2.0:
امرأة بمعطف داكن تمشي عبر زقاق مبلل بالمطر ليلًا.
لقطة تتبع جانبية، إيقاع ثابت. انعكاسات الرصيف المبلل.
سينمائي، كئيب. ضوضاء مطر، لا موسيقى.
Sora 2:
امرأة بمعطف داكن تمشي بثبات عبر زقاق ضيق مبلل بالمطر ليلًا.
تنعكس لافتات النيون على الرصيف المبلل بألوانٍ زاهية.
تتبعها الكاميرا من الجانب على مستوى الخصر. المطر يتساقط برفق.
سينمائي، كئيب.
تقرأ توجيهات H3 كـ قوائم لقطات زمنية. Kling يقرأ كـ ضوابط مُهيكلة. Seedance يقرأ كـ ملخصات مشهد. Sora يقرأ كـ سرد وصفي.
مقارنة إصدارات MiniMax H3
| الإصدار | الدقة | المدة | الصوت | الميزة الرئيسية | الأنسب لـ |
|---|---|---|---|---|---|
| H3 (الأساسي) | حتى 2K | 5-15 ثانية | ستيريو | أوزان مفتوحة، متعدد الوسائط | النشر المحلي، التجريب |
| H3 Max (fal) | حتى 2K | 5-15 ثانية | ستيريو محسن | مدرب مسبقًا، نقطة نهاية للمخرج | جودة الإنتاج، إعلانات |
| H3 Turbo | 768 بكسل | 5-10 ثوانٍ | ستيريو | توليد سريع | مسودات، اختبار دفعات |
متى تستخدم كل نسخة:
- H3 الأساسي: سير عمل مفتوح المصدر، ComfyUI، نشر محلي على بطاقة رسومية
- H3 Max: إعلانات تجارية، أفلام علامة تجارية، محتوى رئيسي
- H3 Turbo: تكرار سريع، اختبار A/B، مسودات سريعة
الأسئلة المتكررة: توجيه MiniMax H3
ما هي صيغة توجيه MiniMax H3؟
الصيغة المكوّنة من 6 كتل: [الإطار الافتتاحي] + [فعل الموضوع] + [استجابة البيئة] + [مسار الكاميرا] + [الصوت] + [الإطار النهائي]. هذه السلسلة تعطي H3 جدولًا زمنيًا يتبعه بدلاً من كومة صفات لتفسيرها.
ما هو الطول المثالي لتوجيه MiniMax H3؟
يقبل H3 حتى 7,000 حرف، لكن معظم التوجيهات الفعّالة تتكون من 3-6 جمل. الأطول ليس أفضل — الوضوح هو الأفضل. يجب أن تحدد كل جملة بعدًا واحدًا: الإطار الافتتاحي، الفعل، الكاميرا، الصوت، أو الحالة النهائية.
كيف أكتب حوارًا لـ MiniMax H3؟
ضع السطور الدقيقة بين علامات الاقتباس. سمّ كل متحدث بوصفه ونبرة صوته. اجعل السطور قصيرة — احسب توقيتها بصوت عالٍ. حدد اللغة. للمشاهد متعددة المتحدثين، أضف “تحرك شفاههم فقط أثناء سطورهم” لتجنب التزامن الخاطئ.
ما الفرق بين توجيه H3 للنص إلى فيديو وتوجيهه للصورة إلى فيديو؟
النص إلى فيديو يتطلب منك تعريف الإطار الافتتاحي بالكامل من الصفر. الصورة إلى فيديو يستخدم الصورة التي حمّلتها كالإطار الافتتاحي — يجب أن يصف توجيهك ما يحدث بعد الصورة، لا أن يعيد وصف ما هو مرئي بالفعل.
كم عدد ملفات المراجع التي يمكن أن يقبلها H3؟
حتى 12 ملفًا إجمالًا: 9 صور، 3 مقاطع فيديو (كل منها من 5 إلى 15 ثانية)، و3 مقاطع صوتية. يجب أن يكون لكل مرجع دور صريح — لا تحمل مراجع متضاربة تجعل النموذج يخمن أيها يتبع.
هل يستطيع H3 إظهار النص وعناصر واجهة المستخدم؟
نعم. يُعد H3 قويًا في إظهار نص واضح، ترجمات، شعارات علامات تجارية، وعناصر واجهة المستخدم. حدد النص الدقيق الذي تريد إظهاره وموقعه على الشاشة.
لماذا يتجاهل H3 أجزاء من توجيهك؟
الأسباب الشائعة: عدد كبير من الإجراءات المتراصة، حركات كاميرا متضاربة، مراجع شخصيات غامضة، أو حوار طويل جدًا للمدة. احذف التعليمات الثانوية واختبر تغييرًا واحدًا في كل مرة.
أين يمكنني استخدام MiniMax H3؟
يتوفر H3 على fal.ai (API، دفع حسب الاستخدام)، C Dance AI (واجهة ويب)، ComfyUI (نشر محلي بأوزان مفتوحة)، ومنصة MiniMax. كما يضم مجتمع VideosPrompt توجيهات H3 يمكنك دراستها وتعديلها.
الخاتمة
MiniMax H3 هو نموذج المخرج. لا يريد صفات — يريد قائمة لقطات.
الإطار بسيط:
- حدد الإطار الافتتاحي — ما هو قبل أن تبدأ الحركة
- صف فعلًا واحدًا — مع السبب والنتيجة، ليس الفعل فقط
- حدد الكاميرا — حركة واحدة، مسار واحد، تعليم واحد
- وجه الصوت — حوار، ضوضاء، مؤثرات، موسيقى كطبقات منفصلة
- ثبت الإطار النهائي — أين تنتهي الأمور
- احمِ العناصر الحساسة — قيود صريحة للنص، اليدين، الوجوه
ابدأ بالقوالب أعلاه. استبدل مواضيعك. أنشئ، قارن، وحسّن.
كل مقطع يبني intuition الخاص بك حول كيفية تفسير H3 للتعليمات الزمنية. بعد 50 توليدًا، لن تحتاج إلى القوالب — ستنظر إلى المشهد وترى قائمة اللقطات تحته.
قصصك تستحق دقة 2K وصوت ستيريو. الآن تعرف كيف تُخرجها.
آخر تحديث: سبتمبر 2026
هل ترغب في استكشاف المزيد؟ تصفح مجتمع VideosPrompt للحصول على آلاف توجيهات الفيديو المدروسة لجميع النماذج — بما فيها مجموعات MiniMax H3 المخصصة. أو جرّب SocialToPrompt لتفكيك أي فيديو إلى توجيه قابل لإعادة الاستخدام.
مشاركة المقال