Macro Micro News Global Pulse. Local Truth.

Как L1*-регуляризация меняет мультимодальный обнаружение аномалий: новый стандарт семантической точности

03 October 2026 · 2 min read

We compile, generate and translate using Artificial Intelligence from the below given source. Macro Micro News is responsible for its editorial publication.

Article image by A Chosen Soul
Image by A Chosen Soul

В мире, где данные поступают из бесчисленных источников, традиционные методы обнаружения аномалий часто не успевают за изменениями. Большинство существующих алгоритмов опираются на одномерные входные данные, такие как только текст или только изображения. Они упускают сложные взаимосвязи, определяющие реальные сценарии. Это ограничение приводит к неточным решениям, когда аномалии тонкие или скрыты в разнообразных потоках данных. Чтобы устранить этот пробел, исследователи представили MSENet. Это новая сквозная мультимодальная сеть с улучшенной семантикой, специально разработанная для надежного обнаружения новизны.

MSENet основана на принципе, согласно которому нормальные данные разделяют общую семантическую информацию в разных модальностях, тогда как аномалии нарушают эту гармонию. Архитектура состоит из двух основных модулей: сети извлечения признаков и сети семантического анализа. Во время обучения модель обрабатывает мультимодальные входные данные, такие как текст, видео и аудио, через асимметричные автокодировщики, адаптированные под специфические размеры каждой модальности. Извлеченные признаки затем объединяются с помощью операции конкатенации и передаются в модуль семантического анализа. Здесь сеть учится извлекать общие семантические представления, эффективно заполняя семантические разрывы между различными типами данных. Эти извлеченные семантические данные впоследствии снова объединяются с исходными признаками для создания семантически усиленных представлений, которые затем реконструируются. Основная идея заключается в том, что модель будет высококачественно реконструировать нормальные образцы, но испытывать трудности с точной реконструкцией аномальных данных. Таким образом, система маркирует их на основе ошибки реконструкции.

Ключевым нововведением в этой структуре является введение L1*-регуляризации. Стандартная L1-регуляризация способствует разреженности, обнуляя веса, но иногда бывает слишком агрессивной или жесткой. L1* вводит гибкий штрафной член на основе L1-нормы. Он преобразован так, чтобы поощрять более разреженные веса во время оптимизации, не ограничивая модель чрезмерно. Этот метод выбирает более репрезентативные признаки. Он гарантирует, что сеть фокусируется на наиболее информативных аспектах данных, а не на шуме или нерелевантных вариациях. Сочетание семантического улучшения MSENet с выбором признаков L1* обеспечивает превосходную производительность системы в выявлении новшеств.

Экспериментальная проверка проводилась на двух известных мультимодальных наборах данных: MUStARD (обнаружение сарказма) и UR-FUNNY (универсально смешное). В этих тестах сарказм и юмор считались «нормальными» классами, тогда как несаркастичный и неюмористический контент служил аномалиями. Результаты показали, что MSENet с L1*-регуляризацией превосходит современные методы, включая глубокие автокодировщики (DAE), машины опорных векторов одного класса (OC-SVM), оценку ядерной плотности (KDE) и Deep SVDD. На наборе данных MUStARD предложенный метод достиг показателя площади под кривой (AUC) 69,956%. Этот результат значительно выше показателей ближайших конкурентов. Исследования абляции подтвердили, что как модуль семантического анализа, так и регуляризатор L1* независимо вносят вклад в эффективность модели. Статистический анализ подтвердил значимость этих улучшений.

Несмотря на высокую эффективность на MUStARD, метод столкнулся с трудностями на наборе данных UR-FUNNY. Все модели работали на уровне случайного угадывания. Анализ показал, что это связано со структурой самого набора данных. Отрицательные выборки были взяты из тех же видео, что и положительные. Они имели одних и тех же спикеров и условия записи. Без контекстных подсказок, таких как маркеры смеха, визуальные и аудиосигналы lacked достаточной дискриминационной силы. Это подчеркивает важность контекста в мультимодальном обучении. Тем не менее успех на MUStARD демонстрирует потенциал архитектур с улучшенной семантикой для обработки сложных реальных данных. Этот подход предлагает универсальную рамку, применимую к различным областям. Она охватывает контроль качества в промышленности и мониторинг метеорологических спутников. Это прокладывает путь к созданию более надежных и интеллектуальных систем обнаружения аномалий.