Como a SANet reduz em 90% os custos de treinamento de IA multimodal e aumenta a precisão
We compile, generate and translate using Artificial Intelligence from the below given source. Macro Micro News is responsible for its editorial publication.
O cenário dos Modelos de Linguagem Grande Multimodais está mudando rapidamente. Sistemas como LLaVA, InternVL e Qwen-VL transformaram a forma como as máquinas interpretam dados visuais. Ainda assim, um obstáculo persistente permanece. Criar conjuntos de dados de instrução de alta qualidade exige recursos significativos. O processo é caro e demorado. Frequentemente, os dados resultantes contêm ruído ou redundância. Métodos tradicionais de escala introduzem um alinhamento fraco entre imagens e texto. Esse desequilíbrio leva a ciclos de treinamento ineficientes.
Os pesquisadores responderam com a SANet, uma Rede de Seleção e Augmentação. Esta estrutura oferece uma abordagem inovadora para a construção eficiente de dados de instrução multimodal. Ela opera sob orçamentos de dados fixos. Diferente de métodos de seleção estática que simplesmente filtram dados existentes, a SANet usa um processo iterativo de ciclo fechado. Ele envolve seleção, refinamento, suplementação e reavaliação. Este ciclo garante que apenas as amostras mais valiosas contribuam para o treinamento do modelo. A sobrecarga computacional cai drasticamente enquanto o desempenho se mantém alto.
A SANet depende de dois mecanismos principais. A Seleção Multicritério identifica amostras candidatas com base na cobertura de distribuição e relevância de otimização. A Augmentação de Nível Duplo refina amostras individuais e suplementa capacidades sub-representadas. Os candidatos aumentados não entram no conjunto final imediatamente. Eles passam por etapas subsequentes de re-seleção. Esta etapa extra garante a qualidade antes da inclusão.
Experimentos usando um orçamento de dados fixo de 6% do conjunto LLaVA-1.5 destacam a eficiência da SANet. O modelo alcançou uma pontuação média de 61,88 nos benchmarks ScienceQA, MMBench e TextVQA. Este resultado superou a seleção aleatória e outras bases como LESS-MM. O subconjunto compacto reduziu o tempo total de treinamento para cerca de 35 horas. O ajuste fino com todos os dados exigia 67 horas. O subconjunto construído também mostrou forte reutilização entre modelos. Ele funcionou bem quando aplicado a diferentes backbones como Qwen2-VL-7B e InternVL2.5-8B. Nenhuma reconstrução específica do backbone foi necessária.
A análise revela algumas limitações em tarefas de raciocínio composicional fino. O desempenho no benchmark GQA mostra espaço para melhoria. O processo de augmentação ocasionalmente introduz erros sutis de raciocínio ou ancoragem visual. Isso afeta o desempenho em métricas de avaliação altamente específicas. Apesar disso, a SANet marca um avanço significativo na IA centrada em dados. Ela oferece um pipeline prático para treinar modelos multimodais de próxima geração. Ao desacoplar a construção de dados do treinamento do modelo, as organizações podem criar conjuntos reutilizáveis. Isso acelera os ciclos de desenvolvimento e reduz a dependência de recursos computacionais massivos.