Vision par ordinateur : ce que les modèles récents changent pour l'automobile
Les architectures de vision ont changé de génération. Ce que cela ouvre pour l'analyse d'un véhicule, et ce qui reste hors de portée des modèles actuels.
L'analyse automatique d'images de véhicules repose sur des briques de vision par ordinateur qui ont beaucoup évolué en quelques années. Le mouvement général est documenté : les détecteurs convolutionnels, longtemps dominants, cohabitent désormais avec des architectures à attention, des modèles de segmentation pilotables par une consigne et des modèles multimodaux capables de relier une image à du texte. Ces évolutions n'ont pas la même portée pratique selon les tâches d'inspection concernées.
Des détecteurs aux modèles généralistes
La première génération d'outils reposait sur des réseaux convolutionnels entraînés à reconnaître un catalogue fermé de classes : un pare-chocs, une portière, une rayure. Efficaces sur ce qu'ils avaient vu, ils se dégradaient nettement dès que la scène s'écartait du jeu d'entraînement. La montée des architectures à attention a déplacé le curseur : ces modèles exploitent mieux le contexte global d'une image et se transfèrent plus facilement d'un domaine à un autre.
La conséquence la plus tangible est une réduction du volume d'annotation nécessaire pour atteindre un niveau donné. Un modèle pré-entraîné sur un corpus très large peut être spécialisé avec un nombre d'exemples sensiblement plus faible qu'auparavant. Le travail d'annotation des données d'inspection ne disparaît pas pour autant : il se déplace vers les cas difficiles et vers le contrôle qualité des jeux de validation.
Segmentation promptable et multimodalité
Deux familles de modèles retiennent l'attention des équipes techniques. La segmentation promptable permet d'isoler une zone à partir d'une indication simple — un point, un rectangle, parfois un mot — sans que le modèle ait été entraîné sur cette catégorie précise. Appliquée à une carrosserie, elle facilite la délimitation d'une zone abîmée dont la forme ne correspond à aucune classe prédéfinie.
Les modèles multimodaux image-texte, eux, produisent une description en langage naturel de ce qu'ils observent. Cela ouvre des usages de contrôle : vérifier qu'une prise de vue correspond bien à la consigne donnée, signaler une photo inexploitable, résumer un dossier pour un gestionnaire. Leur emploi pour un jugement chiffré reste en revanche délicat, tant leurs sorties sont sensibles à la formulation de la consigne et peu stables d'une exécution à l'autre.
À retenir Les architectures récentes améliorent surtout la généralisation et réduisent le besoin d'annotation. Elles ne résolvent pas la question de la mesure, qui reste conditionnée par la qualité de la prise de vue.
Ce qui reste difficile
Trois obstacles résistent. Le premier est métrologique : passer d'une détection à une dimension exploitable — longueur d'une rayure, profondeur d'un enfoncement — suppose une référence d'échelle que l'image seule ne fournit pas toujours. Les approches par cadrage contrôlé ou par repères géométriques apportent des réponses partielles, jamais universelles.
Le deuxième est optique. Une carrosserie est une surface réfléchissante : un reflet de nuage, une ombre portée, une trace d'eau produisent des signatures visuelles proches de celles d'un défaut réel. La distinction se joue souvent sur la cohérence entre plusieurs vues d'une même zone, ce qui plaide pour des protocoles de captation redondants plutôt que pour un modèle plus lourd. C'est l'un des arguments récurrents du débat entre vidéo guidée et séries de photos.
Le troisième tient aux conditions dégradées : faible luminosité, véhicule sale, pluie, espace de manœuvre réduit. Aucune architecture ne compense entièrement une information absente de l'image, et les protocoles opérationnels prévoient généralement une reprise de la captation plutôt qu'une extrapolation hasardeuse.
Une évaluation qui devient centrale
À mesure que les modèles se généralisent, la question de leur évaluation prend le pas sur celle de leur architecture. Un taux global de bonne détection dit peu de chose s'il n'est pas décliné par type de dommage, par condition de prise de vue et par segment de véhicule. Les équipes qui suivent cette discipline raisonnent en jeux de test stratifiés et en analyse systématique des erreurs, plutôt qu'en score unique communiqué hors contexte.
Cette exigence de traçabilité n'est plus seulement une bonne pratique d'ingénierie. Elle rejoint les attentes réglementaires en cours de déploiement sur la documentation des systèmes d'intelligence artificielle, qui demandent de savoir décrire les limites d'un modèle autant que ses performances.