SANet ने मल्टीमोडल AI ट्रेनिंग की लागत को 90% कम किया है और सटीकता बढ़ाई है
We compile, generate and translate using Artificial Intelligence from the below given source. Macro Micro News is responsible for its editorial publication.
मल्टीमोडल लार्ज लैंग्वेज मॉडल्स का क्षेत्र तेजी से बदल रहा है। LLaVA, InternVL और Qwen-VL जैसे सिस्टम ने मशीनों के दृश्य डेटा को समझने के तरीके में क्रांति ला दी है। फिर भी एक बड़ी चुनौती बनी हुई है। उच्च गुणवत्ता वाले इंस्ट्रक्शन-ट्यूनिंग डेटासेट बनाने में भारी संसाधनों की आवश्यकता होती है। यह प्रक्रिया महंगी और समय लेने वाली है। अक्सर मिले डेटा में शोर या दोहराव पाया जाता है। पारंपरिक स्केलिंग विधियों से छवि और टेक्स्ट के बीच कमजोर एलाइनमेंट होता है। इस असंतुलन के कारण ट्रेनिंग चक्र असक्षम हो जाते हैं।
शोधकर्ताओं ने SANet प्रस्तुत किया है। इसे एक सिलेक्शन-ऑगमेंटेशन नेटवर्क कहा जाता है। यह फ्रेमवर्क कुशल मल्टीमोडल इंस्ट्रक्शन डेटा निर्माण के लिए एक नवीन दृष्टिकोण प्रदान करता है। यह स्थिर डेटा बजट पर काम करता है। स्टैटिक सिलेक्शन विधियों के विपरीत जो केवल मौजूदा डेटा को फ़िल्टर करती हैं, SANet एक इटेरेटिव क्लोज्ड-लूप प्रक्रिया का उपयोग करता है। इसमें सिलेक्शन, रिफाइनमेंट, सप्लीमेंटेशन और री-एवल्यूएशन शामिल हैं। यह चक्र सुनिश्चित करता है कि केवल सबसे अधिक मूल्यवान नमूने ही मॉडल ट्रेनिंग में योगदान दें। कंप्यूटेशनल ओवरहेड काफी कम हो जाता है जबकि प्रदर्शन उच्च बना रहता है।
SANet दो मुख्य तंत्रों पर निर्भर करता है। मल्टी-क्राइटेरिया सिलेक्शन डिस्ट्रीब्यूशन कवरेज और ऑप्टिमाइजेशन प्रासंगिकता के आधार पर उम्मीदवार नमूनों की पहचान करता है। बाई-लेवल ऑगमेंटेशन व्यक्तिगत नमूनों को परिष्कृत करता है और कम प्रतिनिधित्व वाले क्षमताओं की पूर्ति करता है। महत्वपूर्ण बात यह है कि ऑगमेंटेड उम्मीदवार तुरंत अंतिम सबसेट में शामिल नहीं होते। वे बाद के री-सिलेक्शन चरणों से गुजरते हैं। इस अतिरिक्त कदम से शामिल होने से पहले गुणवत्ता की गारंटी मिलती है।
LLaVA-1.5 डेटासेट से निश्चित 6% डेटा बजट का उपयोग करने वाले प्रयोगों ने SANet की दक्षता को उजागर किया। मॉडल ने ScienceQA, MMBench और TextVQA बेंचमार्क में औसतन 61.88 अंक हासिल किए। इस परिणाम ने रैंडम सिलेक्शन और LESS-MM जैसे अन्य बेसलाइन्स को पीछे छोड़ दिया। कॉम्पैक्ट सबसेट ने एंड-टू-एंड ट्रेनिंग समय को लगभग 35 घंटों तक कम कर दिया। पूरे डेटा के साथ फाइन-ट्यूनिंग में 67 घंटे लगते थे। निर्मित सबसेट ने मजबूत क्रॉस-मॉडल पुन: उपयोगिता भी दिखाई। इसे Qwen2-VL-7B और InternVL2.5-8B जैसे अलग-अलग बैकबोन पर लागू करने पर यह प्रभावी रूप से काम किया। किसी भी बैकबोन-विशिष्ट पुनर्निर्माण की आवश्यकता नहीं थी।
विश्लेषण से पता चलता है कि फाइन-ग्रेंड कंपोजिशनल रीज़निंग कार्यों में कुछ सीमाएं हैं। GQA बेंचमार्क पर प्रदर्शन में सुधार की गुंजाइश है। ऑगमेंटेशन प्रक्रिया कभी-कभी सूक्ष्म रीज़निंग या विसुअल-ग्रॉउंडिंग त्रुटियां पेश करती है। ये विशिष्ट मूल्यांकन मेट्रिक्स पर प्रदर्शन को प्रभावित करती हैं। इसके बावजूद, SANet डेटा-केंद्रित AI में एक महत्वपूर्ण پیشगामी है। यह अगली पीढ़ी के मल्टीमोडल मॉडल्स के ट्रेनिंग के लिए एक व्यावहारिक पाइपलाइन प्रदान करता है। डेटा निर्माण को मॉडल ट्रेनिंग से अलग करके, संगठन पुन: उपयोग करने योग्य डेटासेट बना सकते हैं। यह विकास चक्र को तेज करता है और भारी कंप्यूटेशनल संसाधनों पर निर्भरता को कम करता है।