Comment l'IA aide les véhicules autonomes à faire face aux dangers routiers inédits
Des chercheurs de General Motors Israël présentent RAD et JointDiffuse, deux cadres d'intelligence artificielle innovants pour résoudre les cas limites de la conduite autonome.

Les véhicules autonomes sont confrontés à un défi critique connu sous le nom de Long Tail : des scénarios routiers rares et imprévus que les modèles d'IA n'ont jamais rencontrés lors de leur entraînement. Lorsqu'une voiture autonome fait face à une poussette abandonnée ou à un obstacle inhabituel sur une autoroute en pleine nuit, les algorithmes de vision par ordinateur standard peinent souvent. Des chercheurs de General Motors Israël — Michael Balterksa, Oded Bialer et Dan Levi — ont proposé une nouvelle approche appelée Retrieval-Augmented Depth (RAD) pour résoudre ce problème.
L'approche Retrieval-Augmented Depth (RAD)
Estimer la profondeur à partir d'une seule image sans capteurs de profondeur dédiés ou LiDAR reste un obstacle majeur en vision par ordinateur. Bien que les modèles performent bien sur des objets familiers, ils échochent face à des éléments rares. Publié dans les actes de CVPR Findings, le cadre RAD permet au réseau de neurones de rechercher des exemples sémantiques similaires dans une base de données externe lors de l'exécution, les utilisant comme indices géométriques via un mécanisme appelé Matched Cross-Attention. Cela reflète les méthodes RAG dans les grands modèles de langage en extrayant des données externes pertinentes à la volée.
Testé sur des ensembles de données de référence, RAD a atteint une amélioration relative de 29,2 % de la précision AbsRel sur NYU Depth v2 pour les objets non familiers, une amélioration de 13,3 % sur KITTI pour les données de conduite autonome, et un gain de 7,2 % sur Cityscapes. Bien que le système exige une charge de calcul et un temps d'exécution plus élevés, il équipe efficacement les systèmes autonomes pour gérer les cas limites sans réentraîner les modèles de base.
Génération de données synthétiques avec JointDiffuse
Au-delà de l'estimation de la profondeur, les véhicules autonomes reposent sur une détection précise des objets. L'entraînement de ces détecteurs nécessite des ensembles massifs de données annotées, coûteux et lents à produire. Les modèles de diffusion génératifs offrent une solution en créant des images d'entraînement synthétiques, mais des annotations de boîtes englobantes précises sont essentielles. Les méthodes traditionnelles conditionnent soit la génération sur des boîtes prédéfinies — limitant la diversité — soit génèrent des images d'abord et les annotent ensuite, risquant des erreurs d'étiquetage.
Pour surmonter cette limitation, Roi Uziel et Oded Bialer ont présenté JointDiffuse lors de la conférence WACV 2026. Cette méthode génère simultanément des images et des cartes de segmentation alignées sur les pixels grâce à un processus de diffusion conjointe. Stable Diffusion gère la génération d'images tandis qu'un réseau plus petit traite les cartes de segmentation, permettant à la structure de la scène et aux annotations d'évoluer simultanément.
Évalué sur les ensembles de données COCO et nuImages, JointDiffuse a considérablement amélioré les performances des détecteurs d'objets en fournissant des données d'entraînement synthétiques diverses et parfaitement alignées.





