Mesurer la performance d'un modèle de détection : mAP, précision, rappel
En bref — La performance d'un modèle de détection se mesure par la précision (part d'alertes justes), le rappel (part de dommages retrouvés), leur compromis F1, et le mAP, qui agrège ces valeurs sur toutes les classes à un ou plusieurs seuils d'IoU. Aucun de ces chiffres n'a de sens sans le jeu de test, la taxonomie et les seuils qui l'ont produit.
Définitions rigoureuses des métriques de détection, lecture du mAP, coût asymétrique des erreurs et protocole de test à exiger d'un fournisseur.
Évaluer un modèle de détection consiste à comparer, sur des images que le modèle n'a jamais vues, ce qu'il prédit et ce qu'un annotateur a déclaré comme vérité terrain. Cette confrontation produit des métriques : précision, rappel, F1, IoU, mAP. Aucune ne suffit seule, et aucune n'a de valeur sans le protocole qui l'a produite.
Cet article les définit dans le contexte d'une inspection de véhicule et explique comment le coût métier des erreurs doit gouverner le réglage du modèle.
Ce que mesure réellement un modèle de détection
Un modèle de détection remplit deux tâches simultanées : localiser et classer. Sur une photo d'aile avant, il doit délimiter la zone d'une rayure et déclarer qu'il s'agit d'une rayure, et non d'un reflet. À chaque prédiction, il associe un score de confiance compris entre 0 et 1.
Trois sources d'erreur coexistent donc, et les confondre fausse toute lecture des résultats :
- l'erreur de localisation : le dommage est vu, mais la boîte englobante déborde ou n'en couvre qu'une fraction ;
- l'erreur de classification : la zone est bien délimitée, mais l'étiquette est fausse, par exemple un éclat qualifié de rayure ;
- l'erreur de détection : rien n'est prédit là où un dommage existe, ou quelque chose est prédit là où il n'y a rien.
Cette mécanique vaut pour toutes les tâches de vision par ordinateur appliquée à l'automobile.
Vrai positif, faux positif, faux négatif appliqués à l'inspection
Les issues possibles d'une prédiction se définissent par confrontation à la vérité terrain annotée. Appliquées à la détection des dommages de carrosserie, elles se lisent ainsi.
| Issue | Définition | Exemple sur une inspection |
|---|---|---|
| Vrai positif (VP) | Une prédiction correspond, en position et en classe, à un dommage annoté | Un enfoncement sur la portière arrière gauche est détecté et correctement étiqueté |
| Faux positif (FP) | Une prédiction ne correspond à aucun dommage annoté | Un reflet de lampadaire sur un capot noir signalé comme rayure |
| Faux négatif (FN) | Un dommage annoté n'est associé à aucune prédiction | Une rayure fine sur un pare-chocs gris texturé, non détectée |
| Vrai négatif (VN) | Absence de prédiction là où il n'y a rien à détecter | Non dénombrable en détection : une image contient une infinité de zones sans dommage |
La dernière ligne mérite attention. En détection d'objets, contrairement à la classification d'images, les vrais négatifs ne se comptent pas. La notion d'exactitude globale, qui suppose de dénombrer les quatre cases, est donc inutilisable : on raisonne en précision et en rappel.
Précision, rappel, F1 et IoU
La précision : combien d'alertes sont justifiées
La précision est la proportion de prédictions correctes parmi les prédictions émises, soit VP divisé par VP + FP. Une précision de 0,90 signifie qu'une alerte sur dix est infondée. Elle répond à la question : quand le modèle signale un dommage, puis-je le croire ?
Le rappel : combien de dommages réels sont retrouvés
Le rappel est la proportion de dommages réels détectés, soit VP divisé par VP + FN. Un rappel de 0,80 signifie qu'un dommage sur cinq est manqué. Il répond à la question : le modèle voit-il tout ce qu'il devrait voir ?
Le F1 : un compromis, pas une vérité
Le F1 est la moyenne harmonique de la précision et du rappel : il pénalise les modèles déséquilibrés. Commode pour comparer deux variantes d'un même modèle, il masque l'arbitrage qui intéresse le métier : préfère-t-on manquer un dommage ou en inventer un ?
L'IoU : à partir de quand une boîte est-elle correcte
L'IoU, ou intersection sur union, mesure le recouvrement entre la boîte prédite et la boîte annotée : l'aire de leur intersection divisée par l'aire de leur union. Une valeur de 1 correspond à une superposition parfaite, une valeur de 0 à une absence de recouvrement. Un seuil, fréquemment fixé à 0,5, décide si la prédiction compte comme vrai positif.
Ce seuil n'est pas un détail : une même détection peut être vrai positif à 0,5 et faux négatif à 0,75. Les petits objets, éclats ou impacts de gravillon, sont mécaniquement pénalisés, car quelques pixels de décalage y font chuter l'IoU bien plus vite que sur une grande zone enfoncée.
À retenir Une métrique de détection est un triplet : la valeur, le seuil de confiance et le seuil d'IoU. Communiquer la valeur seule revient à donner une distance sans préciser l'unité.
mAP@0.5 et mAP@0.5:0.95 : lire la métrique de référence
La précision moyenne, ou AP, est l'aire sous la courbe précision-rappel d'une classe donnée, obtenue en balayant tous les seuils de confiance. Le mAP est la moyenne des AP sur l'ensemble des classes de la taxonomie. C'est la métrique de référence pour comparer des modèles de détection.
Deux variantes circulent, et elles ne sont pas interchangeables :
- mAP@0.5 : calculé à un seuil d'IoU unique de 0,50, indulgent sur la qualité du contour.
- mAP@0.5:0.95 : moyenne des mAP calculés pour des seuils d'IoU de 0,50 à 0,95 par pas de 0,05. Beaucoup plus exigeant sur la localisation, il donne toujours une valeur nettement inférieure au mAP@0.5 pour un même modèle.
Deux conséquences pratiques. Comparer un mAP@0.5 annoncé par un fournisseur à un mAP@0.5:0.95 mesuré en interne n'a aucun sens. Et la moyenne entre classes dissimule les disparités : un modèle peut afficher un mAP honorable tout en échouant sur deux classes rares qui coûtent cher. Le détail par classe est plus informatif que l'agrégat.
Matrice de confusion et courbe précision-rappel
La matrice de confusion croise les classes réelles en lignes et les classes prédites en colonnes. La diagonale rassemble les bonnes réponses ; tout écart révèle une confusion entre classes. Une ligne et une colonne « fond » comptabilisent les dommages manqués et les détections inventées.
Son intérêt est diagnostique. Si les rayures profondes sont massivement prédites comme superficielles, le problème tient à la frontière entre deux classes, donc à la taxonomie ou au guide d'annotation des données d'inspection : aucune augmentation du volume d'entraînement ne corrigera une consigne ambiguë.
La courbe précision-rappel trace l'évolution conjointe des deux métriques lorsque le seuil de confiance varie. Chaque point est un réglage possible du système, ce qui permet de choisir un point de fonctionnement en connaissance de cause plutôt que de conserver un seuil par défaut.
Pourquoi un taux de précision annoncé seul ne veut rien dire
Un fournisseur qui annonce une « précision de 95 % » n'a rien communiqué d'évaluable. Six informations manquent, et chacune peut déplacer le résultat de plusieurs dizaines de points :
- Quel jeu de test ? Des photos d'atelier éclairées et des vidéos de parking souterrain ne produisent pas les mêmes chiffres.
- Quelle taxonomie ? Un modèle à trois classes larges devance mécaniquement un modèle à quinze classes fines.
- Quel seuil de confiance ? Le relever augmente la précision affichée et dégrade le rappel, sans qu'aucun modèle n'ait changé.
- Quel seuil d'IoU ? Les valeurs 0,5 et 0,75 racontent deux histoires différentes.
- Quelle unité de mesure ? Retrouver tous les dommages d'un véhicule est bien plus difficile qu'obtenir une bonne moyenne par image.
- Comment la vérité terrain a-t-elle été établie ? La qualité du référentiel d'annotation plafonne la qualité mesurée.
À retenir Un chiffre de performance ne se compare qu'à protocole identique. Exigez le jeu de test, la taxonomie, les seuils et le mode d'annotation avant toute comparaison entre deux solutions.
Le coût asymétrique des erreurs doit dicter le seuil
Le seuil de confiance est un curseur métier, pas un paramètre technique. L'abaisser augmente le rappel et dégrade la précision ; le relever produit l'effet inverse. Le bon réglage dépend du coût relatif des deux erreurs dans le processus concerné.
| Contexte | Coût d'un faux négatif | Coût d'un faux positif | Orientation du réglage |
|---|---|---|---|
| Restitution de véhicule en fin de contrat | Dommage non facturé, perte sèche sur la remise en état | Contestation du client, litige, coût de traitement | Rappel élevé, revue humaine systématique des cas facturables |
| Reprise d'un véhicule à distance | Décote non appliquée, marge érodée à la revente | Offre sous-évaluée, abandon du parcours | Équilibre, avec arbitrage humain sur les dommages de forte valeur |
| Expertise d'assurance à distance | Dommage préexistant non relevé, exposition au risque | Instruction inutile, temps d'expert mobilisé | Rappel privilégié, tri par score pour prioriser la revue |
Dans la plupart des usages, un faux négatif coûte plus cher qu'un faux positif : un dommage manqué devient une perte financière ou un litige, alors qu'une fausse alerte est écartée en quelques secondes. Cette asymétrie plaide pour un seuil bas assorti d'un tri : détections très sûres acceptées, détections intermédiaires routées vers une revue humaine, détections faibles écartées. Ce principe structure les parcours d'expertise à distance en assurance, où le temps d'expert est la ressource rare.
La même logique vaut selon que le modèle tourne sur le terminal ou côté serveur : un modèle léger de guidage sera réglé pour le rappel, un modèle d'analyse plus lourd pour la précision.
Construire un jeu de test représentatif
La qualité de l'évaluation dépend du jeu de test. Quelques principes en conditionnent la validité :
- Séparation par véhicule, pas par image. Deux images du même véhicule réparties entre entraînement et test gonflent artificiellement le score.
- Distribution réaliste. Couleurs sombres et claires, carrosseries sales, parkings couverts, contre-jour, pluie, variété de terminaux mobiles.
- Sous-ensemble dédié aux classes rares. Les défauts peu fréquents disparaissent d'un jeu aléatoire ; un sous-jeu spécifique permet de les mesurer séparément.
- Annotation contrôlée. Double annotation puis arbitrage des désaccords, avec un guide écrit et versionné.
- Jeu gelé. Il ne sert ni au réglage des hyperparamètres, ni à un enrichissement au fil des erreurs constatées.
- Jeu adverse. Un lot volontairement difficile — reflets, salissures, autocollants, réparations antérieures — mesure la robustesse plutôt que la moyenne.
À retenir Le jeu de test est un actif à part entière : constitué, documenté et gelé avant toute mesure, il doit rester sous le contrôle de l'organisation qui évalue, non du fournisseur évalué.
Checklist des questions à poser à un fournisseur
Ces questions distinguent une mesure sérieuse d'un argument commercial :
- Sur quel jeu de test le chiffre a-t-il été obtenu, et comment ce jeu a-t-il été constitué ?
- Est-il strictement disjoint des données d'entraînement, au niveau du véhicule ?
- Quelle est la taxonomie complète, et quel est le score par classe ?
- À quels seuils de confiance et d'IoU les valeurs sont-elles calculées ?
- S'agit-il d'un mAP@0.5, d'un mAP@0.5:0.95, d'une précision ou d'un rappel ?
- La mesure est-elle faite par dommage, par image ou par véhicule complet ?
- Le modèle peut-il être évalué sur notre propre jeu de test, dans nos conditions réelles ?
- Comment la performance est-elle suivie en production, et selon quelle procédure de réentraînement ?
La dernière question est la plus révélatrice : un score de laboratoire se dégrade dès que le parc, les terminaux ou les conditions de prise de vue évoluent. Chez Lucius AI, ces métriques sont suivies par classe et par condition de capture plutôt que réduites à un indicateur unique, comme le détaille la page consacrée à notre technologie. Une évaluation sérieuse alimente enfin le calcul du retour sur investissement : c'est le taux de dossiers traités sans intervention humaine, et non le mAP, qui se traduit en euros. Pour échanger sur un protocole de test, vous pouvez nous contacter.