Macro Micro News Global Pulse. Local Truth.

SANet снижает затраты на обучение мультимодального ИИ на 90% и повышает точность

28 September 2026 · 2 min read

We compile, generate and translate using Artificial Intelligence from the below given source. Macro Micro News is responsible for its editorial publication.

Article image by Adrien
Image by Adrien

Ландшафт больших мультимодальных языковых моделей меняется стремительно. Системы LLaVA, InternVL и Qwen-VL радикально изменили подход машин к анализу визуальных данных. Однако сохраняется серьезная проблема. Создание качественных наборов данных для инструктажа требует огромных ресурсов. Этот процесс дорог и занимает много времени. Часто итоговые данные содержат шум или избыточную информацию. Традиционные методы масштабирования приводят к слабой согласованности между изображениями и текстом. Такой дисбаланс вызывает неэффективные циклы обучения.

Исследователи разработали SANet — сеть выбора и дополнения (Selection–Augmentation Network). Эта архитектура предлагает новый подход к созданию эффективных мультимодальных данных для инструктажа. Система работает в рамках фиксированного бюджета данных. В отличие от статических методов фильтрации, SANet использует итеративный замкнутый цикл. Он включает выбор, улучшение, дополнение и повторную оценку. Этот процесс гарантирует, что только самые ценные образцы участвуют в обучении модели. Вычислительные накладные расходы значительно снижаются при сохранении высокой производительности.

В основе SANet лежат два ключевых механизма. Многокритериальный отбор выявляет кандидаты на основе охвата распределения и релевантности оптимизации. Двухуровневое дополнение улучшает отдельные образцы и восполняет пробелы в слабо представленных функциях. Важно отметить, что дополненные кандидаты не попадают в финальный набор сразу. Они проходят дополнительные этапы повторного отбора. Этот шаг гарантирует качество перед включением в базу.

Эксперименты с фиксированным бюджетом данных 6% из набора LLaVA-1.5 демонстрируют эффективность SANet. Модель достигла среднего балла 61,88 по бенчмаркам ScienceQA, MMBench и TextVQA. Этот результат превзошел случайный отбор и другие базовые методы, такие как LESS-MM. Компактный поднабор сократил время сквозного обучения примерно до 35 часов. Полнообъемное тонкое настройка требовала 67 часов. Созданный поднабор также показал высокую совместимость с другими моделями. Он эффективно работал при применении к различным ядрам, таким как Qwen2-VL-7B и InternVL2.5-8B. Специальная реконструкция под конкретное ядро не потребовалась.

Анализ выявил некоторые ограничения в задачах детализированного композиционного рассуждения. Результаты по бенчмарку GQA показывают потенциал для улучшения. Процесс дополнения иногда вносит тонкие ошибки в рассуждения или визуальное обоснование. Это влияет на показатели в узкоспециализированных метриках. Несмотря на это, SANet представляет собой значительный прогресс в области ИИ, ориентированного на данные. Она предлагает практический конвейер для обучения мультимодальных моделей нового поколения. Разделение процесса создания данных и обучения моделей позволяет организациям строить повторно используемые датасеты. Это ускоряет циклы разработки и снижает зависимость от массивных вычислительных мощностей.