Cómo SANet reduce los costos de entrenamiento de IA multimodal en un 90% mientras mejora la precisión
We compile, generate and translate using Artificial Intelligence from the below given source. Macro Micro News is responsible for its editorial publication.
El panorama de los Modelos de Lenguaje Grande Multimodales está cambiando rápidamente. Sistemas como LLaVA, InternVL y Qwen-VL han transformado la forma en que las máquinas interpretan los datos visuales. Sin embargo, persiste un obstáculo importante. Crear conjuntos de datos de ajuste por instrucciones de alta calidad requiere recursos significativos. El proceso es costoso y consume mucho tiempo. A menudo, los datos resultantes contienen ruido o redundancia. Los métodos tradicionales de escalado introducen una alineación débil entre imágenes y texto. Este desequilibrio conduce a ciclos de entrenamiento ineficientes.
Los investigadores han respondido con SANet, una Red de Selección y Aumento. Este marco ofrece un enfoque novedoso para la construcción eficiente de datos de instrucción multimodal. Opera bajo presupuestos de datos fijos. A diferencia de los métodos de selección estática que simplemente filtran los datos existentes, SANet utiliza un proceso iterativo de bucle cerrado. Involucra selección, refinamiento, suplementación y reevaluación. Este ciclo asegura que solo las muestras más valiosas contribuyan al entrenamiento del modelo. La sobrecarga computacional disminuye considerablemente mientras el rendimiento se mantiene alto.
SANet se basa en dos mecanismos principales. La Selección Multicriterio identifica muestras candidatas basándose en la cobertura de distribución y la relevancia de optimización. El Aumento de Dos Niveles refina las muestras individuales y suplementa las capacidades poco representadas. Los candidatos aumentados no ingresan al subconjunto final inmediatamente. Pasan por etapas posteriores de re-selección. Este paso adicional garantiza la calidad antes de su inclusión.
Los experimentos utilizando un presupuesto de datos fijo del 6% del conjunto de datos LLaVA-1.5 destacan la eficiencia de SANet. El modelo logró una puntuación promedio de 61.88 en las pruebas ScienceQA, MMBench y TextVQA. Este resultado superó a la selección aleatoria y otras líneas base como LESS-MM. El subconjunto compacto redujo el tiempo total de entrenamiento a aproximadamente 35 horas. El ajuste fino con todos los datos requirió 67 horas. El subconjunto construido también mostró una fuerte reutilización cruzada entre modelos. Funcionó eficazmente cuando se aplicó a diferentes arquitecturas base como Qwen2-VL-7B e InternVL2.5-8B. No fue necesaria ninguna reconstrucción específica para cada arquitectura.
El análisis revela algunas limitaciones en tareas de razonamiento composicional fino. El rendimiento en la prueba GQA muestra margen de mejora. El proceso de aumento introduce ocasionalmente errores sutiles de razonamiento o anclaje visual. Estos afectan el rendimiento en métricas de evaluación altamente específicas. A pesar de esto, SANet marca un avance significativo en la inteligencia artificial centrada en los datos. Ofrece una canalización práctica para entrenar modelos multimodales de próxima generación. Al desacoplar la construcción de datos del entrenamiento del modelo, las organizaciones pueden crear conjuntos de datos reutilizables. Esto acelera los ciclos de desarrollo y reduce la dependencia de recursos computacionales masivos.