دليل صناعة فيديوهات ملحمية بالذكاء الاصطناعي
يتغير وجه بطلك بين لقطة وأخرى. هذه مشكلة في الآلية، لا في الموجّه (prompt). إليك الأمور الثلاثة التي تحافظ فعلًا على ثبات الشخصية عبر اللقطات.
باختصار
تتغير الشخصيات بين لقطات فيديو الذكاء الاصطناعي لأن كل عملية توليد تعيد تخيّلها من النص، والنص وصف منقوص للوجه. تحل ثلاث آليات هذه المشكلة: الصور المرجعية، التي يدعمها 12 نموذج فيديو؛ والإطار الأول والأخير، الذي يدعمه Seedance 2.0 و2.0 Fast؛ والسلسلة، حيث يحمل كل مقطع الكليب النهائي للمقطع السابق ويكمل من إطاره الأخير. ثبّت الشخصية أولًا، لأن كل اللقطات اللاحقة ترثها.
لدى بطلك ندبة على الخد الأيسر في اللقطة الأولى، ولا ندبة في اللقطة الثانية، وسترة مختلفة بحلول اللقطة الرابعة.
هذه هي المشكلة الحقيقية في فيديو الذكاء الاصطناعي، وهي ليست مشكلة في الموجّه. يمكنك كتابة أدق وصف للشخصية في العالم، ومع ذلك ستنحرف عملية التوليد التالية، لأن كل عملية توليد تبدأ من الصفر وتعيد تخيّل شخصيتك من الكلمات.
الملحمي يعني عدة لقطات تنتمي إلى العالم نفسه. لذا فالحرفة كلها تدور حول الاستمرارية، والاستمرارية مسألة آلية، لا مسألة صياغة.
إليك ما يحافظ فعلًا على ثبات الشخصية عبر اللقطات.
لماذا لا ينجح تكرار الوصف
النصيحة الشائعة هي أن تسمّي الشخصية وتكرر وصف ملابسها في كل موجّه.
هذا يساعد قليلًا، لكنه لا يستطيع حل المشكلة، لأن النص وصف منقوص للوجه. عبارة "امرأة داكنة الشعر في منتصف الثلاثينيات ترتدي سترة جلدية" تنطبق على ملايين الأشخاص، والنموذج يختار شخصًا مختلفًا في كل مرة.
كل لقطة تُولَّد من النص وحده هي تخمين جديد. يتطلب الثبات أن يرى النموذج النتيجة السابقة، لا أن يقرأ عنها.
الآليات الثلاث التي تنجح فعلًا
الصور المرجعية. أعطِ النموذج صورة للشخصية، لا وصفًا لها. يدعم ثلاثة عشر نموذجًا التوليد من المراجع إلى فيديو، منها Seedance 2.0 و2.5، وVeo 3.1، وWan 2.7 و3.0 و3.0 Prime، وKling 3.0 Motion Control، وMiniMax H3، وGemini Omni Flash. يُرسل المرجع مع الطلب، فيُعرض الوجه بدلًا من وصفه.
الإطار الأول والأخير. يقبل نموذجان، هما Seedance 2.0 وSeedance 2.0 Fast، إطار بداية وإطار نهاية معًا، ويولّدان الحركة بينهما. سلّم اللقطة الثانية الإطار الأخير من اللقطة الأولى، فيصبح القطع متصلًا بدلًا من قفزة.
السلسلة. الأقوى بين الثلاث، والسبب في وجود Long Video Generator.
كيف تعمل السلسلة
يُولَّد المقطع الأول من مراجع شخصياتك. ويحمل كل مقطع بعده الكليب النهائي للمقطع السابق كمرجع فيديو ويكمل من إطاره الأخير. كما ترافق مراجع الشخصيات كل مقطع أيضًا.
وبذلك ترى كل لقطة أمرين: من هي الشخصيات، وكيف بدا العالم تمامًا قبل لحظة. تبقى الهوية والبيئة متصلتين، لأنه لا شيء يُعاد تخيّله من الصفر بعد اللقطة الأولى.
هذا هو الفرق بين أربعة كليبات لشخص متشابه الملامح وعمل واحد متصل. تعمل السلسلة على Seedance 2.5، والشرح الكامل موجود في كيفية صناعة فيديوهات طويلة بالذكاء الاصطناعي.
سير عمل متماسك
ثبّت الشخصية قبل توليد أي حركة. احصل أولًا على صورة للشخصية ترضيك. كل اللقطات اللاحقة ترثها، لذا فإن المرجع المتوسط الجودة ينتشر في العمل بأكمله. هذه هي الخطوة التي تستحق أن تمنحها وقتًا حقيقيًا.
حدد ما إذا كنت تحتاج لقطات منفصلة أم تسلسلًا. المشاهد المنفصلة التي تنتقل بين مواقع مختلفة تناسب Series Generator. أما الحدث المتصل الواحد فيناسبه Long Video Generator وسلسلته. الاختيار الخاطئ يكلفك إعادة التوليد، فاختر عن وعي.
اختبر مقطعًا واحدًا قبل الالتزام بثمانية. ولّد الأول، وتفحّص إطاره الأخير بعناية، ولا تكمل إلا إذا كان سليمًا، لأن كل مقطع لاحق في السلسلة يرث ذلك الإطار. أي عيب في المقطع الأول هو عيب في جميع المقاطع.
وجّه الكاميرا بمعزل عن الموضوع. وُجد Kling 3.0 Motion Control والتحكم في الحركة لهذا الغرض تحديدًا. وصف حركة الكاميرا داخل موجّه الموضوع غالبًا لا يمنحك هذا ولا ذاك.
أضف الحوار في النهاية. ولّد الصورة المرئية، ثم انقلها إلى مزامنة الشفاه. أما العكس فيعني أن أي إعادة توليد ستهدر عمل المزامنة.
عن تكلفة الرصيد، ولماذا لا ينبغي لأي مقال أن يذكرها
ستجد أدلة تسرد تكاليف دقيقة بالرصيد لكل نموذج ولكل ثانية. تعامل معها على أنها خيال.
تتغير التكاليف بتغير النماذج والمزودين والحملات. والأهم أن التطبيق يعرض السعر الحقيقي من الخادم قبل التوليد، فترى الرقم الفعلي لإعداداتك الفعلية، لا تقديرًا دوّنه أحدهم قبل أشهر.
راجع عرض السعر داخل الأداة. أسعار الباقات الحالية موجودة في صفحة الأسعار. وكل ما عدا ذلك تخمين متنكر في هيئة مواصفات.
اختيار نموذج دون جدول مقارنة مزيف
لا أحد يملك مقياسًا موثوقًا للثبات يقارن بين النماذج، وكل مقال ينشر مقياسًا كهذا بمنزلتين عشريتين قد اخترعه. ما هو متاح فعلًا هو القدرات والسلوك.
حدث متصل في عالم واحد: Seedance 2.5 عبر السلسلة. صُمم لهذا الغرض تحديدًا.
لقطات منفصلة من مرجع للشخصية: أي من نماذج التوليد من المراجع إلى فيديو الثلاثة عشر. Seedance وVeo 3.1 وWan هي الأكثر استخدامًا.
حركة كاميرا مدروسة: Kling 3.0 Motion Control.
الربط بين إطارين معروفين: Seedance 2.0 أو 2.0 Fast، وهما النموذجان الوحيدان اللذان يدعمان الإطار الأول والأخير.
السرعة أثناء الاستكشاف: إصدارات Fast وTurbo: Seedance 2.0 Fast، وKling 3.0 Turbo، وVeo 3.1 Fast. استكشف بتكلفة منخفضة، وأنهِ بجودة عالية.
القائمة الكاملة في النماذج. يتوفر أربعة وأربعون نموذج فيديو، والنموذج المناسب يعتمد على أيٍّ من الحالات السابقة تعمل عليها.
اللمسات الأخيرة
ارفع الدقة بعد المونتاج لا قبله، باستخدام Video Upscaler. رفع الدقة ثم القص يعني أن تدفع مقابل تحسين إطارات ستتخلص منها.
الترجمة التلقائية لكل ما سيُنشر على وسائل التواصل الاجتماعي، إذ يُشاهد معظمه دون صوت. وShorts Generator لاقتطاع نسخ عمودية من العمل النهائي. وMotion Poster إذا احتجت ملصقًا متحركًا للشخصية نفسها.
الجزء الذي يبقى حرفة
لا شيء من هذا يغني عن معرفة الغرض من اللقطة.
الآليات السابقة تحافظ على ثبات الشخصية. لكنها لا تقرر أين يجب أن تكون الكاميرا، ولا كم تطول اللقطة، ولا عمّ يدور المشهد. الاستمرارية هي الحد الأدنى لا السقف، وهي الحد الأدنى الذي لا يبلغه معظم فيديو الذكاء الاصطناعي، ولهذا يستحق حلها كل هذا الاهتمام.
ثبّت الشخصية، واربط اللقطات في سلسلة، وستتوقف الأدوات عن معاندتك. وما يتبقى هو العمل الحقيقي.
الأسئلة الشائعة
لماذا تتغير شخصيات فيديو الذكاء الاصطناعي بين اللقطات؟▾
لأن كل عملية توليد تبدأ من الصفر وتعيد تخيّل الشخصية من كلماتك. النص وصف منقوص للوجه: عبارة "امرأة داكنة الشعر في منتصف الثلاثينيات ترتدي سترة جلدية" تنطبق على ملايين الأشخاص، فيختار النموذج شخصًا مختلفًا في كل مرة. يتطلب الثبات أن يرى النموذج النتيجة السابقة بدلًا من أن يقرأ عنها.
هل يفيد تكرار وصف الشخصية في كل موجّه؟▾
قليلًا، لكنه لا يحل المشكلة. تكرار الملابس والاسم يوجّه النموذج بعض الشيء، غير أن كل لقطة تُولَّد من النص وحده تبقى تخمينًا جديدًا. الصور المرجعية أو الإطار الأول والأخير أو السلسلة هي ما يحافظ فعلًا على الهوية عبر اللقطات.
ما هي السلسلة في Long Video Generator؟▾
يُولَّد المقطع الأول من مراجع شخصياتك. ويحمل كل مقطع لاحق الكليب النهائي للمقطع السابق كمرجع فيديو ويكمل من إطاره الأخير، مع مرافقة مراجع الشخصيات لكل مقطع. تبقى الهوية والبيئة متصلتين لأنه لا شيء يُعاد تخيّله من الصفر بعد اللقطة الأولى.
ما النماذج التي تدعم الصور المرجعية للشخصيات؟▾
يدعم ثلاثة عشر نموذج فيديو التوليد من المراجع، منها Seedance 2.0 و2.5، وVeo 3.1 وVeo 3.1 Lite، وWan 2.7، وWan 3.0 وWan 3.0 Prime، وKling 3.0 Motion Control، وMiniMax H3، وHappy Horse، وGemini Omni Flash. يُرسل المرجع مع الطلب، فيُعرض الوجه بدلًا من وصفه.
كيف أجعل لقطة تكمل من لقطة أخرى؟▾
استخدم ميزة الإطار الأول والأخير التي يدعمها Seedance 2.0 وSeedance 2.0 Fast. أعطه الإطار الأخير من اللقطة السابقة كإطار بداية، فيولّد الحركة بينه وبين إطار النهاية الذي تحدده، ليصبح القطع متصلًا بدلًا من قفزة.
كم رصيدًا تكلّف سلسلة لقطات متسقة؟▾
لا ينبغي لأي مقال أن يخبرك بذلك، لأن التكاليف تتغير بتغير النماذج والمزودين والحملات. يعرض التطبيق السعر الحقيقي من الخادم قبل التوليد، فترى الرقم الفعلي لإعداداتك الفعلية. راجع عرض السعر داخل الأداة، وصفحة الأسعار لمعرفة أسعار الباقات الحالية.
هل أستخدم Series Generator أم Long Video Generator؟▾
المشاهد المنفصلة التي تنتقل بين مواقع مختلفة تناسب Series Generator. أما الحدث المتصل الواحد فيناسبه Long Video Generator وسلسلته. الاختيار الخاطئ يكلفك إعادة التوليد، لذا حدد شكل عملك قبل أن تبدأ.
