Annotation et qualité des données : le vrai moteur d'un modèle d'inspection
En bref — La performance d'un modèle d'inspection dépend d'abord de son jeu de données : une taxonomie explicite d'éléments et de dommages, un référentiel d'annotation partagé, un accord inter-annotateurs mesuré, une couverture représentative du parc, et des boucles de réentraînement alimentées par les arbitrages humains issus de la production.
À architecture égale, c'est le jeu de données qui départage deux modèles d'inspection. Taxonomie, référentiel et arbitrages humains en constituent le cœur.
Lorsqu'un modèle d'inspection visuelle déçoit, le réflexe courant consiste à changer d'architecture. C'est presque toujours une erreur de diagnostic. À architecture comparable et à volume de calcul comparable, ce qui départe deux modèles est la qualité du jeu de données sur lequel ils ont été entraînés : la cohérence de sa taxonomie, la précision de ses annotations et la représentativité de son échantillon.
Cet article décrit la fabrique de ces données : comment on définit ce que le modèle doit voir, comment on l'annote de manière reproductible, et comment on entretient le corpus dans la durée.
Pourquoi le jeu de données prime sur l'architecture
Les architectures de détection et de segmentation sont aujourd'hui largement disponibles, documentées et interchangeables. Les gains apportés par le passage d'une famille de réseaux à une autre sont réels mais modestes, et se manifestent surtout sur les jeux de données publics de référence. En condition réelle, l'écart de performance entre deux systèmes s'explique principalement par ce qu'ils ont vu à l'entraînement.
La raison tient à la nature du problème. Un véhicule photographié sur un parking présente une combinatoire considérable : forme de carrosserie, couleur et brillance de la peinture, propreté, environnement réfléchi dans les tôles, position du soleil, qualité de l'objectif. Un modèle n'extrapole pas hors de cette combinatoire : il reconnaît ce qui ressemble à son corpus. Élargir et fiabiliser le corpus produit donc des gains bien supérieurs à un changement de réseau, comme le rappelle notre présentation de la chaîne de vision par ordinateur.
À retenir — Avant d'envisager un changement d'architecture, il faut mesurer la cohérence de ses annotations. Un corpus contenant des étiquettes contradictoires impose un plafond de performance qu'aucun modèle ne franchira.
Construire une taxonomie d'éléments et de dommages
La taxonomie est la liste structurée de ce que le modèle doit distinguer. Elle comporte deux axes indépendants : les éléments du véhicule et les dommages qui peuvent les affecter. Les confondre produit une explosion combinatoire ingérable.
L'axe des éléments décrit une nomenclature de carrosserie et d'équipements : pare-chocs avant et arrière, ailes, portes, custodes, capot, hayon, pavillon, vitrage, optiques, rétroviseurs, jantes, bas de caisse. Le niveau de granularité doit être arbitré : distinguer l'aile avant gauche de l'aile avant droite est indispensable pour localiser un dommage, mais subdiviser une porte en trois zones n'apporte rien si le barème de réparation ne le prévoit pas.
L'axe des dommages décrit une nature et une gravité : rayure, éraflure, enfoncement, impact, fissure, élément manquant, corrosion, peinture écaillée, défaut d'alignement. Trois principes gouvernent cet axe. La taxonomie doit être exhaustive, avec une catégorie explicite pour l'indéterminé plutôt qu'un fourre-tout implicite. Elle doit être exclusive, chaque observation relevant d'une seule classe. Elle doit enfin être actionnable : une distinction que le métier ne traite pas différemment ne mérite pas d'exister. La taxonomie doit se calquer sur les postes qu'utilise ensuite le chiffrage de la remise en état.
Les types d'annotation et leurs usages
À chaque question posée au modèle correspond un type d'annotation, dont le coût de production et la valeur informative diffèrent nettement.
| Type d'annotation | Ce qu'il produit | Usage principal | Coût relatif |
|---|---|---|---|
| Boîte englobante | Rectangle et classe | Localiser un élément ou un dommage | Faible |
| Polygone de segmentation | Contour au pixel près | Mesurer une étendue, une surface, une longueur | Élevé |
| Points clés | Positions remarquables | Estimer l'orientation du véhicule, cadrer une vue | Moyen |
| Classification d'attribut | Étiquette au niveau d'une zone ou d'une image | Qualifier une gravité, une propreté, une qualité de prise de vue | Faible |
| Annotation au niveau du dossier | Verdict agrégé sur plusieurs vues | Vérifier la cohérence multi-vues | Moyen |
L'arbitrage le plus structurant oppose la boîte au polygone. La boîte suffit pour savoir qu'un dommage existe et sur quel élément ; elle ne permet pas d'en estimer l'étendue, information pourtant décisive pour la plupart des barèmes. La segmentation est plusieurs fois plus coûteuse à produire, mais elle seule autorise le passage d'une détection de dommage à une estimation exploitable. Une stratégie courante consiste à annoter en boîtes le volume et en polygones un sous-ensemble ciblé.
Le référentiel et l'accord inter-annotateurs
Une taxonomie ne suffit pas : il faut un référentiel d'annotation, document opérationnel qui tranche les cas ambigus. Il répond à des questions très concrètes. Une rayure traversant deux éléments doit-elle être annotée une fois ou deux ? À partir de quelle longueur une éraflure devient-elle une rayure ? Un reflet allongé sur une tôle sombre s'annote-t-il, et sous quelle étiquette ? Une poussière sur l'objectif se traite-t-elle comme un défaut d'image ?
La qualité de ce référentiel se mesure par l'accord inter-annotateurs : on fait annoter un même lot par plusieurs personnes et on compare les résultats. Pour les étiquettes de classe, on emploie des indices d'accord corrigés du hasard ; pour les contours, on compare le recouvrement géométrique entre annotations. Un désaccord élevé sur une classe ne traduit généralement pas l'incompétence des annotateurs, mais une définition insuffisamment opérationnelle, qu'il faut réécrire.
Cette mesure a une conséquence directe sur l'évaluation. Un modèle ne peut pas être plus cohérent que ses données de référence : le niveau d'accord humain constitue de fait le plafond réaliste des indicateurs de performance, sujet approfondi dans notre article sur la mesure de performance d'un modèle de détection.
À retenir — Mesurer l'accord inter-annotateurs avant d'entraîner est l'investissement au meilleur rendement d'un projet de vision. Il révèle les classes mal définies avant qu'elles ne contaminent des dizaines de milliers d'images.
Les cas limites qui font dériver un modèle
Certaines situations dégradent silencieusement les performances parce qu'elles sont rares dans le corpus mais fréquentes sur le terrain.
- Reflets et environnement réfléchi : sur une peinture sombre et brillante, le ciel, un bâtiment ou l'opérateur lui-même se projettent dans la tôle et miment un dommage.
- Véhicule sale ou mouillé : gouttes, boue séchée et traces de lavage produisent des textures que le modèle assimile volontiers à des défauts.
- Ombres portées franches : une ombre rectiligne sur un flanc reproduit la signature visuelle d'une rayure.
- Dommages préexistants réparés : une retouche de peinture, un mastic poncé ou un élément remplacé changent l'aspect local sans constituer un dommage actuel.
- Éléments atypiques : covering, adhésifs publicitaires, aménagements utilitaires, accessoires ajoutés.
- Prises de vue dégradées : flou de bougé, contre-jour, cadrage trop rapproché, surface partiellement hors champ.
La bonne réponse n'est pas de filtrer ces images, mais de les annoter explicitement, y compris avec des étiquettes négatives du type reflet ou salissure. Un modèle qui n'a jamais vu de reflet étiqueté comme tel ne pourra jamais apprendre à l'ignorer. En parallèle, l'annotation de la qualité de prise de vue alimente le guidage en temps réel de l'opérateur, ce qui réduit à la source la proportion d'images difficiles, principe au cœur de la captation guidée.
La couverture du parc et des conditions
Un corpus de grande taille mais concentré sur quelques configurations produit un modèle fragile. La représentativité se pilote sur plusieurs dimensions simultanément.
| Dimension de couverture | Risque en cas de déséquilibre |
|---|---|
| Marques, modèles et carrosseries | Mauvaise segmentation des éléments sur les silhouettes sous-représentées |
| Couleurs et finitions de peinture | Faux positifs sur les teintes sombres et métallisées, plus réfléchissantes |
| Conditions de lumière | Chute de performance en intérieur, de nuit ou en plein soleil |
| Terminaux de captation | Sensibilité au bruit capteur et au traitement d'image propre au téléphone |
| Géographies et saisons | Sous-exposition aux véhicules salés, boueux ou enneigés |
| Types d'usage | Écart entre flottes entretenues et véhicules de particuliers |
Le suivi de ces dimensions suppose de documenter chaque image par des métadonnées de contexte. Sans elles, on ne peut ni diagnostiquer une contre-performance ni planifier une collecte ciblée. Les mêmes exigences valent pour les briques adjacentes, comme la lecture de plaque, où la police, la propreté de la plaque et l'angle de prise de vue forment des dimensions de couverture spécifiques.
Les boucles de réentraînement
Un modèle mis en production génère la matière première de sa propre amélioration, à condition d'organiser la boucle. Le mécanisme comporte quatre temps.
- Collecte des arbitrages : chaque correction d'un opérateur, chaque contestation traitée, chaque validation manuelle constitue une étiquette de forte valeur, car elle porte précisément sur un cas où le modèle a hésité ou s'est trompé.
- Sélection : plutôt que de tout réintégrer, on privilégie les exemples proches de la frontière de décision et les catégories rares, logique d'apprentissage actif qui maximise l'apport par image annotée.
- Réannotation contrôlée : les cas sélectionnés repassent par le référentiel et par un contrôle qualité, sans quoi la boucle propage les erreurs plutôt qu'elle ne les corrige.
- Évaluation avant déploiement : le nouveau modèle est comparé au précédent sur un jeu de test figé, indépendant, qui ne reçoit jamais de données d'entraînement.
Le risque principal de ces boucles est la rétroaction circulaire : si seules les images validées par le modèle sont réintégrées, le corpus se referme progressivement sur ce qu'il sait déjà faire. Maintenir une part de collecte aléatoire, non filtrée par le modèle, est la contrepartie indispensable de l'apprentissage actif.
Gouvernance et confidentialité des données
Les images d'inspection ne sont pas des données neutres. Elles comportent des plaques d'immatriculation, parfois des visages de passants, des documents lisibles dans l'habitacle, des éléments de localisation dans les métadonnées, et un identifiant de véhicule rattachable à une personne. Leur usage à des fins d'entraînement suppose donc un cadre explicite : base de traitement identifiée, durées de conservation définies, minimisation effective, traçabilité des accès et anonymisation des éléments identifiants avant constitution du corpus.
S'y ajoutent des exigences contractuelles : un client fournissant des images attend de savoir si elles alimentent un modèle mutualisé, et selon quelles modalités. Ces sujets sont développés dans notre article consacré au traitement des images d'inspection au regard du RGPD ; ils sont d'ordre général et ne constituent pas un conseil juridique. Chez Lucius AI, la construction du corpus et les règles de gouvernance associées sont documentées et discutées avec chaque partenaire, notamment dans les intégrations destinées aux éditeurs de logiciels.