अलीबाबा की क्यूवेन टीम ने बुधवार को क्यूवेन 2.5 परिवार में एक नया आर्टिफिशियल इंटेलिजेंस (एआई) मॉडल जारी किया। क्यूवेन 2.5 ओमनी को डब किया गया, यह एक फ्लैगशिप-टियर एंड-टू-एंड मल्टीमॉडल मॉडल है। कंपनी का दावा है कि यह वास्तविक समय के पाठ और प्राकृतिक भाषण प्रतिक्रियाओं को उत्पन्न करते हुए, पाठ, चित्र, ऑडियो और वीडियो सहित कई इनपुट को संसाधित कर सकता है। यह कहा जाता है कि इसके विविध कौशल सेट के कारण लागत प्रभावी एआई एजेंटों की इमारत और तैनाती को सक्षम करने के लिए। अलीबाबा ने क्यूवेन 2.5 ओमनी एआई मॉडल के लिए एक नया “थिंकर-टॉकर” आर्किटेक्चर भी नियुक्त किया है।
Qwen 2.5 OMNI AI मॉडल जारी किया
में एक ब्लॉग भेजाक्यूवेन टीम ने नए Qwen 2.5 OMNI AI मॉडल को विस्तृत किया, जो सात बिलियन-पैरामीटर प्रणाली है। इस omnimodal मॉडल की सबसे उल्लेखनीय क्षमता वास्तविक समय भाषण पीढ़ी और वीडियो चैट क्षमता है, जो बड़े भाषा मॉडल (LLM) को प्रश्नों का उत्तर देने और उपयोगकर्ताओं के साथ मौखिक रूप से एक मानवीय तरीके से बातचीत करने की अनुमति देगा। अब तक, यह क्षमता केवल Google और Openai के मॉडल के साथ उपलब्ध है, जो बंद-स्रोत हैं। दूसरी ओर, अलीबाबा ने प्रौद्योगिकी को खोल दिया है।
सुविधाओं के लिए आ रहा है, यह पाठ, चित्र, ऑडियो और वीडियो को इनपुट के साथ -साथ आउटपुट के रूप में स्वीकार करता है। मॉडल वास्तविक समय की आवाज इंटरैक्शन और वीडियो चैट में भी सक्षम है। क्यूवेन टीम ने यह भी कहा कि मॉडल प्राकृतिक तरीके से भाषण की वास्तविक समय की स्ट्रीमिंग भी प्रदान करेगा। इसके अतिरिक्त, यह अंत-से-अंत भाषण निर्देश में बढ़ाया प्रदर्शन के साथ आने का दावा किया जाता है।
क्यूवेन टीम ने इस बात पर प्रकाश डाला कि ओमनी मॉडल एक उपन्यास “थिंकर-टॉकर” आर्किटेक्चर पर बनाया गया है। विचारक घटक मस्तिष्क की तरह कार्य करता है और यह तौर -तरीकों में इनपुट को संसाधित करने और समझने और पाठ आउटपुट उत्पन्न करने के लिए जिम्मेदार है। यह अनिवार्य रूप से एक ट्रांसफार्मर डिकोडर है जो ऑडियो और छवि को एनकोड करता है और सूचना निष्कर्षण के साथ सहायता करता है।
![]()
QWEN 2.5 OMNI बेंचमार्क
फोटो क्रेडिट: अलीबाबा
दूसरी ओर, टॉकर घटक मानव मुंह की तरह काम करता है, शोधकर्ताओं ने कहा। यह थिंकर घटक द्वारा उत्पादित जानकारी को स्ट्रीम करता है और भाषण तरलता के लिए एक स्ट्रीम जैसा आउटपुट उत्पन्न करता है। यह एक दोहरे ट्रैक ऑटोरेग्रेसिव ट्रांसफार्मर डिकोडर के रूप में डिज़ाइन किया गया है। यह संपूर्ण आर्किटेक्चर एक एकल मॉडल के रूप में संचालित होता है, जो वास्तविक समय के पाठ और भाषण पीढ़ी की अनुमति देता है, जो एंड-टू-एंड प्रशिक्षण और अनुमान को सक्षम करता है।
आंतरिक परीक्षण के आधार पर, Qwen 2.5 OMNI AI मॉडल को सर्वव्यापी पर मिथुन 1.5 प्रो मॉडल को बेहतर बनाने के लिए कहा जाता है। यह सिंगल-मोडलिटी कार्यों पर Qwen 2.5-VL-7B, Qwen2-Audio को भी बेहतर बनाता है।
एआई मॉडल अब अलीबाबा के गले लगने वाले चेहरे पर उपलब्ध है प्रविष्टि और गितुब प्रविष्टि। इसके अतिरिक्त, उपयोगकर्ता क्यूवेन चैट के साथ -साथ कंपनी के सामुदायिक मॉडलकॉप के माध्यम से नए मॉडल का परीक्षण कर सकते हैं।

Leave a Reply