प्रेडिक्टिव रिप्रजेंटेशन आंशिक लेबल लर्निंग की अस्पष्टता को कैसे हल करते हैं: एआई डेटा के लिए एक नया मानक
We compile, generate and translate using Artificial Intelligence from the below given source. Macro Micro News is responsible for its editorial publication.
कृत्रिम बुद्धिमत्ता की तेज़ दुनिया में डेटा की गुणवत्ता मॉडल की सफलता के मुख्य बाधक के रूप में खड़ी है। मशीन लर्निंग शोधकर्ता अक्सर आंशिक लेबल लर्निंग (PLL) नामक एक विशिष्ट चुनौती का सामना करते हैं। इस पद्धति में प्रशिक्षण उदाहरणों को एक निश्चित उत्तर के बजाय संभावित लेबलों के सेट से जोड़ा जाता है। ऐसी अस्पष्टता स्वचालित छवि टैगिंग, चिकित्सा निदान और सिफारिश इंजन जैसे वास्तविक अनुप्रयोगों में आम है। जहाँ सटीक लेबलिंग बहुत महंगी होती है या असंभव है। यहाँ मुख्य चुनौती अस्पष्टता को दूर करना है। मॉडल को उम्मीदवार सूची से सही लेबल पहचानना होता है। साथ ही उन्हें एक सटीक वर्गीकरणकर्ता बनाना भी होता है।
आंशिक लेबल लर्निंग को संभालने वाली पारंपरिक विधियाँ मुख्य रूप से केवल मौजूदा फीचर स्पेस का उपयोग करके ग्राफ़ बनाने पर निर्भर करती थीं। ये दृष्टिकोण इन संरचनाओं के माध्यम से लेबलिंग जानकारी को फैलाते हैं। वे फिर भी शोर, आउटलायर्स और उन भिन्नताओं के प्रति संवेदनशील रहते हैं जो वास्तविक वर्गों से संबंधित नहीं हैं। इस कमजोरी से अस्पष्टता प्रक्रिया की विश्वसनीयता काफी कम हो सकती है। इस सीमा को दूर करने के लिए शोधकर्ताओं ने भविष्यवाणी प्रतिनिधित्व पूर्ति (PRA) नामक एक नई ढांचा विकसित किया है। यह विधि पहले से प्रशिक्षित वर्गीकरण मॉडल द्वारा उत्पन्न भविष्यवाणी प्रतिनिधित्व का उपयोग करती है। ये प्रतिनिधित्व लेबल-स्पेस जानकारी को बढ़ावा देते हैं। वे ग्राफ़ निर्माण की दिशा तय करने में मदद करते हैं।
PRA ढांचा प्लग-एंड-प्ले तरीके से काम करता है। इसके लिए मौजूदा बेस विधियों के हाइपरपैरामीटर या अनुकूलन प्रक्रियाओं में कोई बदलाव की आवश्यकता नहीं है। इस प्रक्रिया में तीन अलग-अलग चरण होते हैं। पहले, एक बेस ग्राफ़-आधारित PLL विधि का प्रारंभिक प्रशिक्षण होता है। दूसरे, प्रत्येक उदाहरण के लिए भविष्यवाणी प्रतिनिधित्व उत्पन्न किए जाते हैं। अंत में, मॉडल का पूर्ति के साथ पुनः प्रशिक्षण होता है। इस अंतिम चरण में ग्राफ़ निर्माण के लिए उपयोग किए गए मूल फीचर्स को मानकीकृत भविष्यवाणी प्रतिनिधित्व से बदल दिया जाता है। ये प्रतिनिधित्व कच्चे डेटा की तुलना में बेहतर वर्ग पृथक्करण प्रदान करते हैं।
इसके साथ ही, भविष्यवाणी मॉडल इनपुट को मूल कच्चे फीचर्स और इन भविष्यवाणी प्रतिनिधित्वों को जोड़कर बढ़ाया जाता है। यह सुनिश्चित करता है कि मॉडल पूरे कच्चे डेटा तक पहुँच बनाए रखे। साथ ही वह भेदभावपूर्ण मार्गदर्शन का लाभ भी उठाए। छह विविध बैचमार्क डेटासेट्स पर व्यापक प्रयोग PRA की प्रभावकारिता को दर्शाते हैं। इन डेटासेट्स में Lost, MSRCv2, Mirflickr, BirdSong, Soccer Player और Yahoo! News शामिल हैं।
PL-LEAF, PL-AGGD और PL-CL सहित तीन प्रतिनिधि ग्राफ़-आधारित PLL विधियों पर लागू होने पर, PRA ने होल्म-बोनफेरोनी सुधार के बाद 18 में से 17 युग्मित तुलनाओं में सांख्यिकीय रूप से महत्वपूर्ण सुधार हासिल किया। यह ढांचा लेबल शोर के विभिन्न स्तरों के प्रति मजबूत रहा। इसे केवल दो प्रशिक्षण रनों की आवश्यकता थी। यह पुनरावृत्ति दृष्टिकोणों की तुलना में कंप्यूटेशनली अधिक कुशल है। लेबल-स्पेस अंतर्दृष्टि को ग्राफ़ निर्माण में एकीकृत करके, PRA अस्पष्ट डेटा को संभालने के लिए एक नया मानक स्थापित करता है। यह उन उद्योगों के लिए एक स्केलेबल समाधान प्रदान करता है जहाँ सटीक टिप्पणी उपलब्ध नहीं है।