Macro Micro News Global Pulse. Local Truth.

Como a SANet reduz em 90% os custos de treinamento de IA multimodal e aumenta a precisão

28 September 2026 · 2 min read

We compile, generate and translate using Artificial Intelligence from the below given source. Macro Micro News is responsible for its editorial publication.

Article image by Adrien
Image by Adrien

O cenário dos Modelos de Linguagem Grande Multimodais está mudando rapidamente. Sistemas como LLaVA, InternVL e Qwen-VL transformaram a forma como as máquinas interpretam dados visuais. Ainda assim, um obstáculo persistente permanece. Criar conjuntos de dados de instrução de alta qualidade exige recursos significativos. O processo é caro e demorado. Frequentemente, os dados resultantes contêm ruído ou redundância. Métodos tradicionais de escala introduzem um alinhamento fraco entre imagens e texto. Esse desequilíbrio leva a ciclos de treinamento ineficientes.

Os pesquisadores responderam com a SANet, uma Rede de Seleção e Augmentação. Esta estrutura oferece uma abordagem inovadora para a construção eficiente de dados de instrução multimodal. Ela opera sob orçamentos de dados fixos. Diferente de métodos de seleção estática que simplesmente filtram dados existentes, a SANet usa um processo iterativo de ciclo fechado. Ele envolve seleção, refinamento, suplementação e reavaliação. Este ciclo garante que apenas as amostras mais valiosas contribuam para o treinamento do modelo. A sobrecarga computacional cai drasticamente enquanto o desempenho se mantém alto.

A SANet depende de dois mecanismos principais. A Seleção Multicritério identifica amostras candidatas com base na cobertura de distribuição e relevância de otimização. A Augmentação de Nível Duplo refina amostras individuais e suplementa capacidades sub-representadas. Os candidatos aumentados não entram no conjunto final imediatamente. Eles passam por etapas subsequentes de re-seleção. Esta etapa extra garante a qualidade antes da inclusão.

Experimentos usando um orçamento de dados fixo de 6% do conjunto LLaVA-1.5 destacam a eficiência da SANet. O modelo alcançou uma pontuação média de 61,88 nos benchmarks ScienceQA, MMBench e TextVQA. Este resultado superou a seleção aleatória e outras bases como LESS-MM. O subconjunto compacto reduziu o tempo total de treinamento para cerca de 35 horas. O ajuste fino com todos os dados exigia 67 horas. O subconjunto construído também mostrou forte reutilização entre modelos. Ele funcionou bem quando aplicado a diferentes backbones como Qwen2-VL-7B e InternVL2.5-8B. Nenhuma reconstrução específica do backbone foi necessária.

A análise revela algumas limitações em tarefas de raciocínio composicional fino. O desempenho no benchmark GQA mostra espaço para melhoria. O processo de augmentação ocasionalmente introduz erros sutis de raciocínio ou ancoragem visual. Isso afeta o desempenho em métricas de avaliação altamente específicas. Apesar disso, a SANet marca um avanço significativo na IA centrada em dados. Ela oferece um pipeline prático para treinar modelos multimodais de próxima geração. Ao desacoplar a construção de dados do treinamento do modelo, as organizações podem criar conjuntos reutilizáveis. Isso acelera os ciclos de desenvolvimento e reduz a dependência de recursos computacionais massivos.