كيف يقلل SANet تكاليف تدريب الذكاء الاصطناعي متعدد الوسائط بنسبة 90 في المئة مع تحسين الدقة
We compile, generate and translate using Artificial Intelligence from the below given source. Macro Micro News is responsible for its editorial publication.
يتغير مشهد نماذج اللغات الكبيرة متعددة الوسائط بسرعة. لقد حولت أنظمة مثل LLaVA وInternVL وQwen-VL طريقة تفسير الآلة للبيانات البصرية. لا يزال هناك عائق مستمر. يتطلب إنشاء مجموعات بيانات دقيقة عالية الجودة موارد كبيرة. هذه العملية مكلفة وتستغرق وقتاً طويلاً. غالباً ما تحتوي البيانات الناتجة على ضوضاء أو تكرار. تقدم طرق التوسع التقليدية محاذاة ضعيفة بين الصور والنصوص. يؤدي هذا الاختلال إلى دورات تدريب غير فعالة.
استجاب الباحثون بإنشاء SANet، وهو شبكة اختيار وتكثير. يوفر هذا الإطار نهجاً جديداً لبناء بيانات تعليمية متعددة الوسائط بكفاءة. يعمل ضمن ميزانيات بيانات ثابتة. وعلى عكس طرق الاختيار الثابتة التي تقوم ببساطة بفلترة البيانات الموجودة، تستخدم SANet عملية حلقة مغلقة تكرارية. تتضمن هذه العملية الاختيار والتحسين والتكميل وإعادة التقييم. يضمن هذا الدورة مساهمة العينات الأكثر قيمة فقط في تدريب النموذج. ينخفض الحمل الحسابي بشكل كبير بينما تظل الأداء مرتفعاً.
تعتمد SANet على آليتين أساسيتين. يحدد الاختيار متعدد المعايير العينات المرشحة بناءً على تغطية التوزيع وملاءمة التحسين. يقوم التكثير ذو المستويين بتحسين العينات الفردية وتكميل القدرات الممثلة تمثيلاً ناقصاً. لا تدخل المرشحات المكتملة مباشرة إلى المجموعة النهائية. تخضع لمرحلات إعادة اختيار لاحقة. تضمن هذه الخطوة الإضافية الجودة قبل الإدراج.
سلطت التجارب باستخدام ميزانية بيانات ثابتة تبلغ 6 في المئة من مجموعة بيانات LLaVA-1.5 كفاءة SANet الضوء عليها. حقق النموذج متوسط درجة 61.88 عبر معايير ScienceQA وMMBench وTextVQA. تفوق هذا النتيجة على الاختيار العشوائي والأساسيات الأخرى مثل LESS-MM. قللت المجموعة المدمجة وقت التدريب الشامل إلى حوالي 35 ساعة. تطلب الضبط الدقيق الكامل للبيانات 67 ساعة. أظهرت المجموعة المبنية أيضاً قابلية قوية لإعادة الاستخدام عبر النماذج. عملت بفعالية عند تطبيقها على هياكل خلفية مختلفة مثل Qwen2-VL-7B وInternVL2.5-8B. لم تكن هناك حاجة لإعادة بناء خاصة بكل هيكل خلفي.
يكشف التحليل عن بعض القيود في مهام الاستدراك التركيبي الدقيقة. تظهر الأداء على معيار GQA مجالاً للتحسين. تؤدي عملية التكثير أحياناً إلى أخطاء استدلال أو تأصيل بصري دقيقة. تؤثر هذه الأخطاء على الأداء في مقاييس التقييم المحددة للغاية. على الرغم من ذلك، يمثل SANet تقدماً كبيراً في الذكاء الاصطناعي المتمحور حول البيانات. يقدم خط أنابيب عملياً لتدريب نماذج الجيل القادم متعددة الوسائط. من خلال فصل بناء البيانات عن تدريب النموذج، يمكن للمنظمات بناء مجموعات بيانات قابلة لإعادة الاستخدام. يسرع هذا من دورات التطوير ويقلل الاعتماد على الموارد الحاسوبية الضخمة.