Macro Micro News Global Pulse. Local Truth.

كيف يحوّل التنظيم L1* كشف الشذوذ متعدد الوسائط: معيار جديد للدقة الدلالية

03 October 2026 · 1 min read

We compile, generate and translate using Artificial Intelligence from the below given source. Macro Micro News is responsible for its editorial publication.

Article image by A Chosen Soul
Image by A Chosen Soul

في عالم تتدفق فيه البيانات من مصادر لا حصر لها، تواجه طرق كشف الشذوذ التقليدية صعوبة في مواكبة هذا الزخم. تعتمد معظم الخوارزميات الحالية على مدخلات أحادية الوسيط مثل النصوص أو الصور فقط. يتجاهل هذا النهج الترابطات المعقدة التي تحدد سيناريوهات العالم الحقيقي. تؤدي هذه القيود إلى قرارات غير دقيقة عندما تكون الشذوذات خفية أو مخفية داخل تدفقات بيانات متنوعة. لسد هذه الفجوة الحرجة، قدم الباحثون نموذج MSENet. إنه شبكة دلالية محسنة متعددة الوسائط تعمل بنهاية إلى نهاية ومصممة خصيصًا لكشف الجدة بقوة.

يعمل MSENet على مبدأ مفاده أن البيانات الطبيعية تشترك في معلومات دلالية مشتركة عبر وسائط مختلفة. أما الشذوذات فتزعجم هذا التوازن. تتكون البنية من وحدتين رئيسيتين. الأولى هي شبكة استخراج الميزات والثانية هي شبكة التعدين الدلالي. أثناء التدريب يعالج النموذج مدخلات متعددة الوسائط مثل النصوص والفيديو والصوت. يستخدم مشفرات تلقائية غير متماثلة مصممة لأبعاد كل وسيط. ثم تندمج الميزات المستخرجة عبر عملية الإرفاق وتنتقل إلى وحدة التعدين الدلالي. هنا تتعلم الشبكة استخلاص تمثيلات دلالية مشتركة. تقوم بذلك بربط الفجوات الدلالية بين أنواع البيانات المختلفة. تُدمج هذه الدلالات المستخرجة مرة أخرى مع الميزات الأصلية لإنشاء تمثيلات محسنة دلاليًا. ثم يتم إعادة بناء هذه التمثيلات. الفرضية الأساسية هي أن النموذج سيُعيد بناء العينات الطبيعية بدقة عالية لكنه سيواجه صعوبة في إعادة بناء البيانات الشاذة بشكل دقيق. وبالتالي فإن النظام يكتشفها بناءً على خطأ إعادة البناء.

تتمثل إحدى الابتكارات الرئيسية في هذا الإطار في تقديم التنظيم L1*. بينما يعزز التنظيم L1 القلة عن طريق دفع الأوزان نحو الصفر إلا أنه قد يكون عدوانيًا أو جامدًا أحيانًا. يقدم L1* حد عقاب مرن يعتمد على معيار L1. تم تشكيله لتشجيع أوزان أكثر قلة أثناء التحسين دون تقييد النموذج بشكل مفرط. تختار هذه الطريقة ميزات أكثر تمثيلية. تضمن تركيز الشبكة على الجوانب الأكثر إفادة في البيانات بدلاً من الضوضاء أو التغيرات غير ذات الصلة. من خلال الجمع بين تعزيز الدلالة في MSENet واختيار الميزات في L1* يحقق النظام أداءً فائقًا في تحديد الجدد.

أُجريت التجارب التحققية على مجموعتي بيانات بارزتين متعددتي الوسائط وهما MUStARD وUR-FUNNY. في هذه الاختبارات عُرفت السخرية والضحك بأنهما فئتا "الطبيعي". بينما كانت المحتوى غير الساخر وغير المضحك يعمل كاستثناءات. أظهرت النتائج أن MSENet مع التنظيم L1* تفوق على أحدث الطرق بما في ذلك المشفرات التلقائية العميقة وآلات ناقلات الدعم أحادية الفئة وتقدير كثافة النواة وعميق SVDD. على مجموعة بيانات MUStARD حقق المقترح نسبة Area Under the Curve بلغت 69.956%. وهي أعلى بكثير من أفضل المنافسين. أكدت دراسات الاستئصال أن وحدة التعدين الدلالي ومنظم L1* يساهمان بشكل مستقل في فعالية النموذج. وقد أكد التحليل الإحصائي أهمية هذه التحسينات.

رغم الأداء القوي على MUStARD واجهت الطريقة تحديات على مجموعة UR-FUNNY حيث عملت جميع النماذج بالقرب من مستويات الصدفة. كشف التحليل أن السبب يعود للهيكل الأساسي للمجموعة. فقد سحبت العينات السلبية من نفس الفيديوهات المستخدمة في العينات الموجبة. شاركوا نفس المتحدثين وظروف التسجيل. بدون إشارات سياقية مثل علامات الضحك افتقرت الإشارات البصرية والصوتية إلى قوة تمييز كافية. هذا يبرز أهمية السياق في التعلم متعدد الوسائط. ومع ذلك يؤكد النجاح على MUStARD إمكانات الهياكل المحسنة دلاليًا في التعامل مع بيانات العالم الحقيقي المعقدة. يوفر هذا النهج إطارًا عامًا قابلاً للتطبيق في مجالات متنوعة. بدءًا من مراقبة الجودة الصناعية وحتى مراقبة الأقمار الصناعية الجوية. يمهد الطريق لأنظمة كشف شذوذ أكثر موثوقية وذكية.