रेफ़रेंस से वीडियो ट्यूटोरियल 2026
रेफ़रेंस इमेज कोई स्ट्रेंथ वैल्यू नहीं है। या तो आप मॉडल को एक देते हैं या नहीं देते, और 37 में से तेरह मॉडल इसे स्वीकार कर सकते हैं।
संक्षेप में
वीडियो जनरेशन के 37 में से तेरह मॉडल कैरेक्टर रेफ़रेंस स्वीकार करते हैं: Seedance 2.0, 2.0 Fast और 2.5, Veo 3.1 और 3.1 Lite, Wan 2.7, 3.0 और 3.0 Prime, Kling 3.0 Motion Control, MiniMax H3, Gemini Omni Flash, और दोनों Happy Horse मॉडल। खुद Kling 3.0 इसे स्वीकार नहीं करता। रेफ़रेंस स्ट्रेंथ जैसी कोई वैल्यू नहीं होती, इसलिए नतीजे रेफ़रेंस इमेज से तय होते हैं: सामने से या तीन-चौथाई कोण से, फ़्रेम में बड़ी, समान रोशनी वाली, सामान्य भाव वाली, शार्प, और हर बार बिल्कुल वही फ़ाइल।
रेफ़रेंस इमेज कोई स्ट्रेंथ वैल्यू नहीं है। या तो आप मॉडल को एक देते हैं या नहीं देते।
यहाँ ट्यून करने के लिए कोई 0.75 नहीं है, पीछा करने के लिए कोई लैंडमार्क त्रुटि प्रतिशत नहीं है, और कॉन्फ़िगर करने के लिए कोई एनकोडर सेटिंग नहीं है। कोई कैरेक्टर पूरी क्लिप में एक जैसा रहेगा या नहीं, यह इस बात से तय होता है कि आप कितनी अच्छी इमेज देते हैं और किस मॉडल को देते हैं।
ये दोनों पूरी तरह आपके नियंत्रण में हैं, जो किसी डायल से कहीं बेहतर है।
कौन-से मॉडल वाकई रेफ़रेंस स्वीकार करते हैं
वीडियो जनरेशन के 37 में से तेरह मॉडल। इसमें गलती करना सबसे आम कारण है जिसकी वजह से लोग मान लेते हैं कि रेफ़रेंस से वीडियो "काम नहीं करता":
Seedance 2.0, 2.0 Fast और 2.5 · Veo 3.1 और 3.1 Lite · Wan 2.7, 3.0 और 3.0 Prime · Kling 3.0 Motion Control · MiniMax H3 · Gemini Omni Flash · Happy Horse और Happy Horse 1.1
ध्यान देने लायक गैरमौजूदगी: खुद Kling 3.0। यह केवल टेक्स्ट से वीडियो और इमेज से वीडियो बनाता है। अगर आप Kling 3.0 पर चेहरा अपलोड कर रहे थे और वह उसे अनदेखा कर रहा था, तो वजह यही है — यह क्षमता इसके बजाय Kling 3.0 Motion Control में है।
शुरुआत रेफ़रेंस से वीडियो से करें।
सारा काम रेफ़रेंस इमेज का है
सब कुछ इसी फ़ाइल से आता है, इसलिए यह प्रॉम्प्ट से ज़्यादा ध्यान की हक़दार है।
सामने से या तीन-चौथाई कोण से। प्रोफ़ाइल तस्वीर मॉडल को काम करने के लिए सिर्फ़ एक आँख और आधा जबड़ा देती है, इसलिए वह बाकी हिस्सा खुद गढ़ता है और वह गढ़ा हुआ हिस्सा हर फ़्रेम में बदलता है।
फ़्रेम में बड़ी। वाइड शॉट के छोटे-से हिस्से में दिखने वाले चेहरे में बहुत कम डिटेल होती है। क्रॉप करें।
समान रोशनी। कठोर परछाइयाँ चेहरे की बनावट का हिस्सा बन जाती हैं। सपाट, समान रोशनी मॉडल को असली आकार दिखाती है।
सामान्य भाव। रेफ़रेंस में बड़ी मुस्कान उन शॉट्स में भी बनी रहती है जहाँ उसकी कोई जगह नहीं होती।
शार्प। रेफ़रेंस का धुंधलापन मोशन में जाकर गड़बड़ बन जाता है, और कोई भी प्रॉम्प्ट उसे ठीक नहीं कर सकता।
अगर आप रेफ़रेंस की तस्वीर खींचने के बजाय उसे जनरेट कर रहे हैं, तो सोच-समझकर जनरेट करें: इसी मकसद से बनाया गया साफ़ पोर्ट्रेट किसी और चीज़ से निकाले गए फ़्रेम से बेहतर होता है।
हर जनरेशन में बिल्कुल वही फ़ाइल दोबारा इस्तेमाल करें। मिलती-जुलती इमेज नहीं, वही इमेज। दो मिलती-जुलती रेफ़रेंस इमेज दो मिलते-जुलते लेकिन अलग लोग बनाती हैं, और ठीक यही वह गलती है जिससे आप बचना चाहते हैं।
रेफ़रेंस के इर्द-गिर्द प्रॉम्प्ट लिखना
मॉडल चेहरे को देख सकता है। उसका वर्णन न करें।
"भूरी आँखें, तीखा जबड़ा, काले बाल" जैसे शब्दों पर प्रॉम्प्ट खर्च करना इमेज का साथ देने के बजाय उससे टकराता है, और नतीजे को आपकी दी गई रेफ़रेंस से दूर खींच सकता है।
लिखें कि कैरेक्टर क्या करता है, कहाँ है, और कैमरा क्या करता है:
"वह बंदरगाह की दीवार के साथ धीरे-धीरे चलती है, समुद्र की ओर देखते हुए। बादलों वाली रोशनी। कैमरा साथ-साथ ट्रैक करता है।"
सभी शॉट्स में सेटिंग और रोशनी का वर्णन एक जैसा रखें, सिर्फ़ एक्शन बदलें। इसी तरह क्लिप्स का एक सेट एक ही रचना जैसा लगता है।
पहचान फिर भी क्यों बदलती है
तीन असली कारण, और इनमें से कोई भी छूटी हुई सेटिंग नहीं है।
अवधि। पहचान कुछ सेकंड तक टिकती है और ज़्यादा सेकंड में बिगड़ने लगती है। अगर कोई चेहरा चार सेकंड तक टिकता है और दस सेकंड तक बिखर जाता है, तो छोटी क्लिप्स जनरेट करें और उन्हें जोड़ दें।
रेफ़रेंस की गुणवत्ता। ऊपर इसकी बात हो चुकी है, और यह कहीं ज़्यादा आम कारण है।
गलत मॉडल। अगर मॉडल रेफ़रेंस सपोर्ट नहीं करता, तो रेफ़रेंस का कोई असर ही नहीं होता।
जब रेफ़रेंस से वीडियो सही टूल नहीं है
लगातार सीक्वेंस, अलग-अलग शॉट्स के बजाय। Long Video Generator सेगमेंट्स को जोड़ता है, ताकि हर सेगमेंट पिछले सेगमेंट की तैयार क्लिप साथ लेकर उसके आखिरी फ़्रेम से आगे बढ़े, और रेफ़रेंस पूरे समय साथ रहें। इससे कैरेक्टर के साथ-साथ माहौल भी बना रहता है, जो अकेले रेफ़रेंस से संभव नहीं है।
कोई खास परफ़ॉर्मेंस। Motion Control एक ड्राइविंग वीडियो की मूवमेंट को कैरेक्टर इमेज पर ट्रांसफ़र करता है। जब आपके पास मनचाही मूवमेंट की क्लिप हो, तो उसका वर्णन करने से बेहतर है उसे ट्रांसफ़र करना।
अलग-अलग लोकेशन पर अलग दृश्य। Series Generator इसी के लिए बना है।
सटीक शुरुआती और आखिरी पॉइंट। फ़र्स्ट-टू-लास्ट फ़्रेम, केवल Seedance 2.0 और 2.0 Fast पर।
क्या असली नहीं है
कोई रेफ़रेंस स्ट्रेंथ नहीं। किसी भी मॉडल पर ऐसी कोई वैल्यू नहीं जो तय करे कि रेफ़रेंस को कितना माना जाए।
कोई लैंडमार्क या ड्रिफ़्ट मीट्रिक नहीं। हर मॉडल के लिए चेहरे के बदलाव का कोई प्रकाशित आंकड़ा नहीं, और न ही कोई प्रतिशत जिसके नीचे रहना हो। ऐसा आंकड़ा बताने वाले लेखों ने उसे गढ़ा है।
कोई समर्पित रेफ़रेंस एनकोडर नहीं जिसे आप कॉन्फ़िगर कर सकें, और कहीं भी क्षेत्र-विशेष मास्क नहीं।
एक मॉडल seed देता है: Wan 2.7, जो नेगेटिव प्रॉम्प्ट भी लेता है। यह अकेला ऐसा मॉडल है, इसलिए जब दोहराव हर चीज़ से ज़्यादा मायने रखता है तो यही सही विकल्प है।
एक वर्कफ़्लो जो टिकता है
- एक मज़बूत रेफ़रेंस इमेज बनाएँ और उसे सेव करें।
- उन तेरह में से एक मॉडल चुनें।
- एक्शन और कैमरे के बारे में लिखें, चेहरे के बारे में कभी नहीं।
- छोटी क्लिप्स जनरेट करें। पहचान को क्लिप की शुरुआत में नहीं, अंत में ईमानदारी से परखें।
- हर अगले शॉट के लिए बिल्कुल वही रेफ़रेंस दोबारा इस्तेमाल करें।
नतीजा चरण 1 पर टिका है। उसके बाद का सब कुछ दोहराव है।
कैटलॉग मॉडल्स पर है, हर जनरेशन चलने से पहले उसकी कीमत बताई जाती है, और पैक की कीमतें प्राइसिंग पेज पर हैं।
अक्सर पूछे जाने वाले प्रश्न
कौन-से मॉडल रेफ़रेंस इमेज स्वीकार करते हैं?▾
37 में से तेरह: Seedance 2.0, 2.0 Fast और 2.5, Veo 3.1 और 3.1 Lite, Wan 2.7, 3.0 और 3.0 Prime, Kling 3.0 Motion Control, MiniMax H3, Gemini Omni Flash, और दोनों Happy Horse मॉडल। खुद Kling 3.0 केवल टेक्स्ट से वीडियो और इमेज से वीडियो बनाता है, इसलिए उस पर चेहरा अपलोड करने से कुछ नहीं होता।
मुझे रेफ़रेंस स्ट्रेंथ कितनी सेट करनी चाहिए?▾
किसी भी मॉडल में रेफ़रेंस स्ट्रेंथ नहीं होती। या तो आप रेफ़रेंस देते हैं या नहीं देते। नतीजा इमेज की गुणवत्ता और उसे पाने वाले मॉडल से तय होता है, और ये दोनों पूरी तरह आपके नियंत्रण में हैं।
अच्छी रेफ़रेंस इमेज कैसी होती है?▾
प्रोफ़ाइल की जगह सामने से या तीन-चौथाई कोण से, फ़्रेम में बड़ी, बिना कठोर परछाइयों के समान रोशनी, सामान्य भाव, और शार्प। रेफ़रेंस का धुंधलापन मोशन में जाकर गड़बड़ बन जाता है और कोई भी प्रॉम्प्ट उसे ठीक नहीं कर सकता। हर बार बिल्कुल वही फ़ाइल दोबारा इस्तेमाल करें, क्योंकि दो मिलती-जुलती रेफ़रेंस इमेज दो मिलते-जुलते लेकिन अलग लोग बनाती हैं।
क्या मुझे प्रॉम्प्ट में कैरेक्टर का वर्णन भी करना चाहिए?▾
नहीं। मॉडल चेहरे को देख सकता है। उसका वर्णन इमेज से टकराता है और नतीजे को आपकी दी गई रेफ़रेंस से दूर खींच सकता है। लिखें कि कैरेक्टर क्या करता है, कहाँ है और कैमरा क्या करता है, और सभी शॉट्स में सेटिंग और रोशनी का वर्णन एक जैसा रखें।
चेहरा फिर भी क्यों बदल जाता है?▾
तीन कारण: क्लिप बहुत लंबी है, क्योंकि पहचान कुछ सेकंड तक टिकती है और ज़्यादा सेकंड में बिगड़ने लगती है; रेफ़रेंस इमेज कमज़ोर है; या मॉडल रेफ़रेंस सपोर्ट ही नहीं करता। इनमें से कोई भी किसी छूटी हुई सेटिंग की वजह से नहीं है।
रेफ़रेंस से वीडियो के बजाय कुछ और कब इस्तेमाल करना चाहिए?▾
लगातार सीक्वेंस के लिए Long Video Generator इस्तेमाल करें, क्योंकि चेनिंग कैरेक्टर के साथ-साथ माहौल को भी बनाए रखती है। जब आपके पास उस मूवमेंट की क्लिप हो जिसे आप ट्रांसफ़र करना चाहते हैं, तब Motion Control इस्तेमाल करें। अलग-अलग लोकेशन पर अलग दृश्यों के लिए Series Generator, और जब आपको शुरुआत और अंत की सटीक इमेज पता हों तब फ़र्स्ट-टू-लास्ट फ़्रेम इस्तेमाल करें।
क्या ड्रिफ़्ट या लैंडमार्क सटीकता का कोई मीट्रिक है?▾
नहीं। हर मॉडल के लिए चेहरे के बदलाव का कोई प्रकाशित आंकड़ा नहीं है और न ही कोई प्रतिशत जिसके नीचे रहना हो। लैंडमार्क त्रुटि दरें बताने वाले लेखों ने उन्हें गढ़ा है। एक मॉडल, Wan 2.7, नेगेटिव प्रॉम्प्ट के साथ seed भी देता है, इसलिए जब दोहराव सबसे ज़्यादा मायने रखता है तो वही सही विकल्प है।
