DyMC-YOLO : comment la fusion à double flux accélère la détection en temps réel à 46 FPS
We compile, generate and translate using Artificial Intelligence from the below given source. Macro Micro News is responsible for its editorial publication.
La détection d'objets est un pilier fondamental de la perception visuelle intelligente. Elle alimente des avancées critiques dans la conduite autonome, la vidéosurveillance et l'agriculture de précision. Pourtant, les détecteurs traditionnels du spectre visible peinent souvent dans des conditions difficiles comme une faible luminosité, des reflets ou une occlusion importante. Les chercheurs ont maintenant introduit DyMC-YOLO. Ce nouveau détecteur à double flux fusionne les données RGB et infrarouges pour améliorer les performances dans divers environnements.
DyMC-YOLO s'appuie sur l'architecture YOLOv13. Ce choix a été fait pour son équilibre entre précision et efficacité en temps réel. Le système utilise des branches de backbone symétriques mais paramétrées indépendamment pour les entrées RGB et infrarouges. Une innovation clé réside dans le module de fusion de caractéristiques guidé par un masque complémentaire. Il effectue un pondération spatiale préservant les canaux à trois niveaux sémantiques. Contrairement aux méthodes précédentes qui doublent parfois la largeur des caractéristiques ou nécessitent des projections complexes, ce module génère un seul masque spatial complémentaire. Il adapte ainsi le poids des modalités en fonction du contenu de l'image.
Cette approche préserve les chemins directs de transmission des caractéristiques grâce à des mappages identitaires dans les blocs de fin de réseau. Le modèle introduit également une tête de détection multi-chemin dynamique. Ce composant remplace les structures de prédiction fixes par des blocs de routage dynamique spécifiques à la tâche. Pour chaque échantillon, la tête agrège des chemins de prédiction courts, moyens et longs en utilisant des coefficients conditionnés par l'échantillon. Cela permet au réseau d'ajuster dynamiquement son champ de réceptivité pour les tâches de régression et de classification. L'approche améliore la localisation et la compréhension du contexte sans augmenter significativement la latence computationnelle.
Les évaluations sur le jeu de données M3FD dédié au trafic et sur un jeu de données personnalisé de raisins RGB-NIR ont montré des compromis supérieurs entre précision et efficacité. Sur M3FD, le modèle a atteint une précision moyenne moyenne (mAP) de 51,73 %. Il surpasse ainsi d'autres méthodes de fusion légères basées sur YOLO tout en conservant une empreinte compacte d'environ 8 millions de paramètres. Sur le jeu de données agricole de raisins, il a atteint un mAP de 83,06 %. Cela démontre sa robustesse dans des scènes encombrées et peu éclairées.
Le modèle a fait preuve d'une grande résilience face aux désalignements inter-modales et aux scénarios de modalité manquante. Il conserve une haute précision de détection absolue même sous perturbations contrôlées. Avec une vitesse d'inférence d'environ 46 FPS et une faible consommation mémoire, DyMC-YOLO présente une solution viable pour le déploiement en périphérie sur des unités de traitement neuronal. En combinant efficacement la fusion hiérarchique de caractéristiques avec des chemins de prédiction dynamiques, cette architecture pose une nouvelle norme pour la détection d'objets multimodale fiable en temps réel dans des conditions visuelles difficiles.