बाईडेंस ओमनीहुमान विकसित करता है, एक एआई ढांचा जो मनुष्यों के यथार्थवादी वीडियो उत्पन्न कर सकता है

Tiktok के पीछे की कंपनी Bytedance ने हाल ही में एक नए आर्टिफिशियल इंटेलिजेंस (AI) फ्रेमवर्क पर अपना शोध साझा किया। डबेड ओमनीहुमान, यह एक वीडियो-जनरेशन फ्रेमवर्क है जो पूर्ण-शरीर आंदोलन और लिप-सिंकिंग के साथ यथार्थवादी मानव वीडियो बना सकता है। शोधकर्ताओं ने कहा कि आउटपुट उत्पन्न करने के लिए वीडियो या ऑडियो जैसे गति संकेतों के साथ एक मानव छवि की आवश्यकता होती है। एआई मॉडल का उपयोग करके उत्पन्न कई प्रदर्शन वीडियो भी साझा किए गए हैं, जो अंतिम आउटपुट के यथार्थवाद को प्रदर्शित करते हैं। विशेष रूप से, कंपनी ने कहा कि एआई मॉडल सार्वजनिक डोमेन में उपलब्ध है।

Omnihuman यथार्थवादी मानव वीडियो उत्पन्न कर सकता है

शोधकर्ताओं ने कई प्रदर्शनों को साझा किया और इसके बारे में रूपरेखा को विस्तृत किया वेबसाइट। यह एक एंड-टू-एंड सिस्टम है जिसे एक उपन्यास मल्टीमॉडलिटी मोशन कंडीशनिंग मिश्रित प्रशिक्षण रणनीति का उपयोग करके बनाया गया था, पोस्ट ने दावा किया। जबकि शोधकर्ताओं ने किसी भी बेंचमार्क मेट्रिक्स को साझा नहीं किया, उन्होंने दावा किया कि एआई मॉडल “मौजूदा तरीकों से काफी आगे निकल जाता है।”

Omnihuman व्यक्ति की छवि और एक गति संकेत का उपयोग करके वीडियो उत्पन्न कर सकता है। मोशन सिग्नल केवल ऑडियो, वीडियो या केवल ऑडियो और वीडियो का संयोजन हो सकते हैं। AI मॉडल पाठ संकेतों के आधार पर यथार्थवादी वीडियो उत्पन्न कर सकता है। ये वीडियो पूर्ण-शरीर हो सकते हैं जहां अंग, चेहरे के भाव और लिप मूवमेंट को पृष्ठभूमि में ऑडियो या संगीत बजाने के साथ सिंक किया जा सकता है। Omnihuman विभिन्न पहलू अनुपात में वीडियो उत्पन्न कर सकता है, जिससे उपयोगकर्ताओं को लचीलापन मिल सकता है।

ओमनीहुमान ओमनीहुमान

Omnihuman आउटपुट उदाहरण
फोटो क्रेडिट: Omnihuman

मोशन सिग्नल का उपयोग एक उपन्यास तकनीक है, जिसे कंपनी ओमनी-कंडीशन्स प्रशिक्षण कह रही है। इसके साथ, AI मॉडल को पाठ, छवि, ऑडियो और वीडियो सहित विभिन्न तौर -तरीकों पर प्रशिक्षित किया जाता है। शोधकर्ताओं ने कहा कि इसने मॉडल को मिश्रित कंडीशनिंग सीखने की अनुमति दी जो उच्च गुणवत्ता वाले डेटा की कमी को दूर करती है।

विशेष रूप से, मॉडल को 18,700 घंटे के मानव वीडियो डेटा पर प्रशिक्षित किया गया था। प्रशिक्षण प्रक्रिया के बारे में विवरण एक में प्रलेखित किया गया है कागज़ ऑनलाइन प्री-प्रिंट जर्नल Arxiv में प्रकाशित।

कंपनी ने मॉडल का उपयोग करके उत्पन्न वीडियो के कई प्रदर्शनों को भी साझा किया, और परिणाम प्राकृतिक शरीर के आंदोलनों, हाथ के इशारों और होंठ आंदोलनों के साथ अत्यधिक यथार्थवादी प्रतीत होते हैं। इस तरह के यथार्थवाद ने भी डीपफेक के बारे में चिंताएं बढ़ाई हैं। हालांकि, कंपनी ने निर्दिष्ट किया है कि एआई मॉडल वर्तमान में डाउनलोड करने के लिए उपलब्ध नहीं है, और कोई भी सेवा नहीं है जो लोग अपनी क्षमताओं तक पहुंचने के लिए उपयोग कर सकते हैं।

नवीनतम तकनीकी समाचारों और समीक्षाओं के लिए, गैजेट्स 360 पर पालन करें एक्स, फेसबुक, WhatsApp, धागे और Google समाचार। गैजेट्स और टेक पर नवीनतम वीडियो के लिए, हमारी सदस्यता लें YouTube चैनल। यदि आप शीर्ष प्रभावकों के बारे में सब कुछ जानना चाहते हैं, तो हमारे इन-हाउस का अनुसरण करें कौन है पर Instagram और YouTube

Zomato को ‘शाश्वत’ के रूप में रीब्रांड करने के लिए, नए लोगो का खुलासा करता है


क्वालकॉम का कहना है कि एआरएम ने लाइसेंस ब्रीच नोटिस वापस ले लिया है



Source link