SANet réduit de 90 % les coûts d'entraînement des IA multimodales tout en améliorant la précision
We compile, generate and translate using Artificial Intelligence from the below given source. Macro Micro News is responsible for its editorial publication.
Le paysage des grands modèles de langage multimodaux évolue rapidement. Des systèmes comme LLaVA, InternVL et Qwen-VL ont transformé l'interprétation des données visuelles par les machines. Un obstacle persiste cependant. La création de jeux de données d'instruction de haute qualité exige d'importantes ressources. Le processus est coûteux et long. Les données obtenues contiennent souvent du bruit ou des redondances. Les méthodes d'échelle traditionnelles créent un alignement faible entre les images et le texte. Ce déséquilibre ralentit les cycles d'entraînement.
Les chercheurs ont développé SANet, un réseau de sélection et d'augmentation. Cette approche propose une méthode novatrice pour construire efficacement des données d'instruction multimodales. Elle fonctionne avec des budgets de données fixes. Contrairement aux méthodes statiques qui filtrent simplement les données existantes, SANet utilise un processus itératif en boucle fermée. Il combine sélection, affinage, complétion et réévaluation. Ce cycle garantit que seuls les échantillons les plus précieux alimentent l'entraînement du modèle. La surcharge computationnelle chute considérablement tandis que la performance reste élevée.
SANet repose sur deux mécanismes clés. La sélection multicritère identifie les candidats selon la couverture de distribution et la pertinence d'optimisation. L'augmentation à deux niveaux affine les échantillons individuels et comble les lacunes dans les capacités sous-représentées. Les candidats augmentés n'intègrent pas immédiatement le sous-ensemble final. Ils subissent des étapes de resélection supplémentaires. Cette étape supplémentaire assure la qualité avant l'inclusion.
Des expériences menées avec un budget de données fixe de 6 % issu du jeu LLaVA-1.5 soulignent l'efficacité de SANet. Le modèle a obtenu une note moyenne de 61,88 sur les benchmarks ScienceQA, MMBench et TextVQA. Ce résultat dépasse la sélection aléatoire et d'autres références comme LESS-MM. Le sous-ensemble compact a réduit le temps d'entraînement global à environ 35 heures. Le réglage fin sur l'ensemble des données nécessitait 67 heures. Le sous-ensemble construit montre également une forte réutilisabilité inter-modèles. Il s'est avéré efficace appliqué à différentes architectures comme Qwen2-VL-7B et InternVL2.5-8B. Aucune reconstruction spécifique à l'architecture n'était nécessaire.
L'analyse révèle certaines limites dans les tâches de raisonnement compositionnel fin. La performance sur le benchmark GQA laisse place à des améliorations. Le processus d'augmentation introduit parfois des erreurs subtiles de raisonnement ou d'ancrage visuel. Ces défauts affectent les résultats sur des métriques d'évaluation très spécifiques. Malgré cela, SANet marque une avancée majeure vers une IA centrée sur les données. Il offre un pipeline pratique pour entraîner les modèles multimodaux de nouvelle génération. En dissociant la construction des données de l'entraînement du modèle, les organisations peuvent créer des jeux de données réutilisables. Cela accélère les cycles de développement et réduit la dépendance aux énormes ressources computationnelles.