Technologie

Computer vision automobile : comment une IA analyse l'état d'un véhicule

Publié le 5 mars 2026 · 9 min de lecture

Illustration d'une analyse par ordinateur d'une carrosserie de véhicule avec zones détectées et contours

En bref — La computer vision automobile analyse des images ou une vidéo d'un véhicule en sept étapes : acquisition guidée, prétraitement, détection des éléments de carrosserie, segmentation des zones abîmées, classification des dommages, agrégation des observations issues de plusieurs vues, puis application de règles métier. Le résultat est un état des lieux structuré, limité à ce qui est visible.

De la prise de vue au rapport structuré : les sept étapes de la chaîne de vision par ordinateur appliquée à l'état d'un véhicule, et ses limites réelles.

La computer vision automobile désigne l'ensemble des techniques qui permettent à un logiciel d'interpréter des images ou des vidéos d'un véhicule pour en déduire des informations exploitables : quels éléments de carrosserie sont visibles, où ils se situent, et s'ils présentent des anomalies. Appliquée à l'inspection, elle transforme une captation faite au smartphone en un état des lieux structuré, comparable d'un dossier à l'autre.

Cet article décrit la chaîne complète, de la prise de vue jusqu'au rapport final, en explicitant le vocabulaire technique et les limites réelles de la discipline.

Qu'est-ce que la computer vision appliquée au véhicule ?

La computer vision appliquée au véhicule consiste à faire produire par un modèle statistique, à partir de pixels, trois catégories de sorties : la localisation d'objets dans l'image, leur classe (pare-chocs avant, aile arrière gauche, rétroviseur), et un état associé (intact, rayé, enfoncé, manquant). Le modèle n'a aucune compréhension mécanique du véhicule : il a appris des régularités visuelles sur un grand volume d'images annotées.

Cette distinction est importante pour comprendre les performances observées. Un modèle bien entraîné reconnaît très correctement ce qui ressemble à ce qu'il a déjà vu, et se dégrade dès que la scène s'écarte de sa distribution d'apprentissage : éclairage inhabituel, carrosserie très sale, véhicule atypique, angle de prise de vue extrême. Toute la conception d'un produit d'inspection consiste à réduire cet écart, notamment par la maîtrise du protocole de captation.

À retenir — Un modèle de vision ne « voit » pas un véhicule, il estime des probabilités sur des motifs visuels. La fiabilité d'une inspection dépend donc autant de la qualité des images fournies que de la qualité du modèle lui-même.

Les étapes de la chaîne de traitement

Une chaîne d'inspection visuelle complète comporte sept étapes, exécutées en partie sur le terminal de l'utilisateur et en partie côté serveur.

  1. Acquisition : capture de la vidéo ou des photos, avec guidage de l'opérateur (position, distance, angle, couverture des faces).
  2. Prétraitement : sélection des images nettes, correction d'exposition, redimensionnement, normalisation colorimétrique, rejet des plans inexploitables.
  3. Détection d'objets : localisation du véhicule dans le cadre, puis des éléments de carrosserie et des zones suspectes.
  4. Segmentation : délimitation au pixel près des contours d'un élément ou d'un dommage, pour en mesurer l'étendue.
  5. Classification : attribution d'une nature et d'une gravité au dommage détecté.
  6. Agrégation multi-vues : fusion des observations issues de plusieurs images d'un même élément en une conclusion unique.
  7. Post-traitement métier : application des règles du client (nomenclature des pièces, seuils d'acceptation, franchises, arbitrage humain).

Pourquoi le prétraitement conditionne tout le reste

Une captation vidéo produit un grand nombre d'images très redondantes, dont une fraction seulement est exploitable. Le flou de mouvement, les reflets spéculaires sur une carrosserie vernie, la sous-exposition en parking couvert éliminent mécaniquement une partie des plans. Le prétraitement sélectionne les meilleures vues par élément plutôt que de traiter tout le flux, ce qui améliore à la fois la précision et le coût de calcul.

Le vocabulaire technique expliqué

Quelques termes reviennent systématiquement dans les discussions techniques et les appels d'offres. Voici leur signification opérationnelle.

  • CNN (réseau de neurones convolutif) : architecture historique de la vision par ordinateur, qui applique des filtres successifs pour extraire des motifs de plus en plus abstraits, des bords aux formes complexes. Robuste, économe, encore très utilisée en embarqué.
  • Transformer de vision (ViT) : architecture plus récente qui découpe l'image en fragments et modélise leurs relations globales. Elle capte mieux le contexte général d'une scène, au prix d'un besoin de données et de calcul supérieur.
  • Bounding box : rectangle englobant qui indique la position approximative d'un objet. Suffisant pour compter et localiser, insuffisant pour mesurer une surface.
  • Segmentation sémantique : attribution d'une classe à chaque pixel, sans distinguer les instances. Tous les pixels « portière » sont regroupés.
  • Segmentation d'instance : même principe, mais chaque occurrence est séparée. Deux rayures distinctes sur la même portière sont comptées comme deux objets.
  • Score de confiance : probabilité estimée par le modèle que sa prédiction soit correcte. Il sert à fixer des seuils de déclenchement et à orienter les cas douteux vers un opérateur.
  • Faux positif / faux négatif : dommage annoncé mais inexistant / dommage réel mais non détecté. Les deux erreurs n'ont pas le même coût métier, ce qui influence le réglage des seuils.

Détection, segmentation, classification : trois tâches distinctes

Ces trois tâches sont souvent confondues alors qu'elles répondent à des questions différentes et n'ont pas le même coût d'annotation ni la même utilité métier.

TâcheQuestion poséeSortieUsage métierCoût d'annotation
Classification d'imageQue montre cette image ?Une étiquette globaleTri des plans, contrôle de complétudeFaible
Détection d'objetsOù se trouve l'élément ?Bounding box + classeRepérage des pièces et des zones suspectesMoyen
Segmentation d'instanceQuelle est sa forme exacte ?Masque au pixel prèsMesure de longueur et de surface d'un dommageÉlevé
Estimation de gravitéEst-ce grave ?Classe ordonnée + scoreChiffrage, décision de remise en étatÉlevé, expertise requise

En pratique, une solution d'inspection combine les quatre. La détection identifie les pièces pour situer le dommage dans la nomenclature, la segmentation en mesure l'étendue, la classification en qualifie la nature et la sévérité. Le détail de cette qualification est développé dans l'article consacré à la détection des dommages de carrosserie.

L'agrégation multi-vues : du plan isolé au rapport véhicule

Une inspection fiable ne repose jamais sur une image unique. Le même impact apparaît sur plusieurs plans, sous des angles et des éclairages différents, et le modèle produit une prédiction indépendante sur chacun. L'agrégation multi-vues consiste à réconcilier ces observations pour éviter de compter cinq fois le même choc, et pour arbitrer entre des prédictions contradictoires.

Trois mécanismes sont généralement combinés :

  • Le suivi temporel : sur une vidéo, une même région est suivie d'une image à l'autre, ce qui permet de rattacher les détections à un objet unique.
  • L'ancrage sur la pièce : chaque détection est projetée sur l'élément de carrosserie auquel elle appartient, ce qui fournit un référentiel stable indépendant du cadrage.
  • Le vote pondéré par la confiance et la qualité d'image : une détection issue d'un plan net et bien exposé pèse davantage qu'une détection issue d'un plan flou ou en contre-jour.

Cette étape est décisive : un modèle médiocre avec une bonne agrégation produit souvent un rapport plus utilisable qu'un excellent modèle sans réconciliation. Elle explique aussi pourquoi les indicateurs mesurés image par image sont trompeurs, sujet traité dans l'article sur la mesure de performance d'un modèle de détection.

Le post-traitement métier

Le post-traitement métier convertit des sorties statistiques en décisions conformes aux règles du client. C'est la couche qui différencie le plus les solutions entre elles, parce qu'elle encode des conventions propres à chaque secteur.

Elle prend en charge la correspondance avec la nomenclature de pièces utilisée par le donneur d'ordre, l'application de seuils d'acceptation contractuels, le rattachement au véhicule via son identification par VIN ou plaque, la comparaison avec un état antérieur lorsqu'il existe, et le routage vers un opérateur humain des cas dont la confiance est insuffisante. Chez Lucius AI, cette couche est paramétrable par cas d'usage plutôt que figée dans le modèle.

À retenir — La performance d'un système d'inspection ne se réduit pas à celle de son réseau de neurones. Prétraitement, agrégation multi-vues et règles métier pèsent autant que l'architecture du modèle dans la qualité du rapport final.

Cas d'application

La même chaîne technique sert des finalités très différentes selon le métier, avec des exigences de précision et de traçabilité distinctes.

  • Assurance : constat d'état à la souscription, expertise à distance, vérification de cohérence entre déclaration et images lors d'un sinistre. Voir le cas d'usage expertise à distance pour les assureurs.
  • Location courte durée : états des lieux de départ et de retour, comparaison automatique des deux captations pour isoler les dommages apparus pendant la période.
  • Location longue durée : évaluation des frais de remise en état à la restitution d'un véhicule en LLD, avec un enjeu fort de justification auprès du client final.
  • Remarketing et vente VO : constitution d'un état détaillé pour la mise en vente, cohérence des annonces, aide à la cotation du véhicule d'occasion.
  • Concessions : réception d'atelier, reprise, contrôle avant et après intervention.

Limites et zones d'incertitude

Les limites de la computer vision automobile sont structurelles et connues. Les annoncer clairement vaut mieux que de les découvrir en production.

  • La profondeur d'un défaut n'est pas observable depuis une image standard. Distinguer une rayure de vernis d'une rayure atteignant l'apprêt reste incertain sans lumière rasante ni mesure physique.
  • Les conditions de prise de vue dominent le reste. Reflets, pluie, poussière, éclairage artificiel et carrosseries très sombres dégradent fortement la détection.
  • L'invisible reste invisible. Usure mécanique, état du groupe motopropulseur, historique d'entretien ou dommages structurels masqués échappent par nature à l'analyse d'image.
  • Le chiffrage n'est pas la détection. Estimer un coût suppose des référentiels de temps et de pièces, sujet abordé dans l'article sur le chiffrage automatique de réparation.
  • La fraude évolue. Réutilisation d'images antérieures, captation d'un autre véhicule ou retouche appellent des contrôles spécifiques, décrits dans l'article sur la détection de la fraude à l'assurance automobile.

Ces limites n'invalident pas l'approche : elles définissent le périmètre où l'automatisation apporte un gain net, et celui où l'intervention humaine reste nécessaire. Pour une vue d'ensemble de ce périmètre, l'article pilier sur l'inspection automobile par intelligence artificielle détaille ce qui peut et ne peut pas être automatisé, et la page technologie présente l'architecture retenue.

À retenir — Une image renseigne sur l'état visible de la carrosserie et du vitrage, rien de plus. Tout engagement contractuel fondé sur une inspection automatisée doit délimiter explicitement ce périmètre.

Questions fréquentes

Quelle différence entre détection d'objets et segmentation ?

La détection d'objets localise un élément par un rectangle englobant et lui attribue une classe : elle répond à la question « où » et « quoi ». La segmentation délimite l'objet au pixel près et permet donc de mesurer sa longueur ou sa surface. Pour une rayure, seule la segmentation autorise une estimation d'étendue exploitable dans un barème de remise en état.

Faut-il une vidéo ou des photos pour une analyse par computer vision ?

Les deux fonctionnent, mais la vidéo guidée offre une redondance naturelle : chaque zone est vue sous plusieurs angles, ce qui alimente l'agrégation multi-vues et limite les oublis. Les photos guidées restent pertinentes quand la connectivité est faible ou que le protocole impose une couverture précise du véhicule. Le choix dépend surtout du taux de complétude visé et du profil des utilisateurs.

Qu'est-ce qu'un score de confiance et comment l'utiliser ?

Le score de confiance est la probabilité estimée par le modèle que sa prédiction soit juste. Il ne mesure pas la gravité d'un dommage. En production, on définit un seuil haut au-dessus duquel la détection est acceptée automatiquement, un seuil bas en dessous duquel elle est ignorée, et une zone intermédiaire routée vers un opérateur humain.

Les modèles de vision fonctionnent-ils sur tous les types de véhicules ?

Les véhicules particuliers et utilitaires légers courants sont bien couverts, car largement représentés dans les données d'apprentissage. Les véhicules atypiques — carrosseries spécifiques, poids lourds, engins aménagés, livrées publicitaires — demandent souvent un enrichissement des jeux de données. C'est un point à vérifier explicitement lors d'une phase pilote.

L'analyse se fait-elle sur le smartphone ou sur un serveur ?

Les deux approches coexistent. Le guidage temps réel et les contrôles de qualité d'image s'exécutent sur le terminal pour éviter toute latence. L'analyse fine des dommages et l'agrégation multi-vues s'exécutent plus souvent côté serveur, où la puissance de calcul est disponible. L'arbitrage entre les deux dépend de la connectivité, du coût et des contraintes de confidentialité.

Une question sur votre cas précis ?

Décrivez-nous votre parcours actuel : nous vous dirons franchement ce que l'IA peut y changer, et ce qu'elle ne changera pas.