Données

Mesurer la performance d'un modèle de détection : mAP, précision, rappel

Publié le 9 juin 2026 · 9 min de lecture

Courbe précision-rappel et matrice de confusion illustrant l'évaluation d'un modèle de détection appliqué à l'inspection d'un véhicule

En bref — La performance d'un modèle de détection se mesure par la précision (part d'alertes justes), le rappel (part de dommages retrouvés), leur compromis F1, et le mAP, qui agrège ces valeurs sur toutes les classes à un ou plusieurs seuils d'IoU. Aucun de ces chiffres n'a de sens sans le jeu de test, la taxonomie et les seuils qui l'ont produit.

Définitions rigoureuses des métriques de détection, lecture du mAP, coût asymétrique des erreurs et protocole de test à exiger d'un fournisseur.

Évaluer un modèle de détection consiste à comparer, sur des images que le modèle n'a jamais vues, ce qu'il prédit et ce qu'un annotateur a déclaré comme vérité terrain. Cette confrontation produit des métriques : précision, rappel, F1, IoU, mAP. Aucune ne suffit seule, et aucune n'a de valeur sans le protocole qui l'a produite.

Cet article les définit dans le contexte d'une inspection de véhicule et explique comment le coût métier des erreurs doit gouverner le réglage du modèle.

Ce que mesure réellement un modèle de détection

Un modèle de détection remplit deux tâches simultanées : localiser et classer. Sur une photo d'aile avant, il doit délimiter la zone d'une rayure et déclarer qu'il s'agit d'une rayure, et non d'un reflet. À chaque prédiction, il associe un score de confiance compris entre 0 et 1.

Trois sources d'erreur coexistent donc, et les confondre fausse toute lecture des résultats :

  • l'erreur de localisation : le dommage est vu, mais la boîte englobante déborde ou n'en couvre qu'une fraction ;
  • l'erreur de classification : la zone est bien délimitée, mais l'étiquette est fausse, par exemple un éclat qualifié de rayure ;
  • l'erreur de détection : rien n'est prédit là où un dommage existe, ou quelque chose est prédit là où il n'y a rien.

Cette mécanique vaut pour toutes les tâches de vision par ordinateur appliquée à l'automobile.

Vrai positif, faux positif, faux négatif appliqués à l'inspection

Les issues possibles d'une prédiction se définissent par confrontation à la vérité terrain annotée. Appliquées à la détection des dommages de carrosserie, elles se lisent ainsi.

IssueDéfinitionExemple sur une inspection
Vrai positif (VP)Une prédiction correspond, en position et en classe, à un dommage annotéUn enfoncement sur la portière arrière gauche est détecté et correctement étiqueté
Faux positif (FP)Une prédiction ne correspond à aucun dommage annotéUn reflet de lampadaire sur un capot noir signalé comme rayure
Faux négatif (FN)Un dommage annoté n'est associé à aucune prédictionUne rayure fine sur un pare-chocs gris texturé, non détectée
Vrai négatif (VN)Absence de prédiction là où il n'y a rien à détecterNon dénombrable en détection : une image contient une infinité de zones sans dommage

La dernière ligne mérite attention. En détection d'objets, contrairement à la classification d'images, les vrais négatifs ne se comptent pas. La notion d'exactitude globale, qui suppose de dénombrer les quatre cases, est donc inutilisable : on raisonne en précision et en rappel.

Précision, rappel, F1 et IoU

La précision : combien d'alertes sont justifiées

La précision est la proportion de prédictions correctes parmi les prédictions émises, soit VP divisé par VP + FP. Une précision de 0,90 signifie qu'une alerte sur dix est infondée. Elle répond à la question : quand le modèle signale un dommage, puis-je le croire ?

Le rappel : combien de dommages réels sont retrouvés

Le rappel est la proportion de dommages réels détectés, soit VP divisé par VP + FN. Un rappel de 0,80 signifie qu'un dommage sur cinq est manqué. Il répond à la question : le modèle voit-il tout ce qu'il devrait voir ?

Le F1 : un compromis, pas une vérité

Le F1 est la moyenne harmonique de la précision et du rappel : il pénalise les modèles déséquilibrés. Commode pour comparer deux variantes d'un même modèle, il masque l'arbitrage qui intéresse le métier : préfère-t-on manquer un dommage ou en inventer un ?

L'IoU : à partir de quand une boîte est-elle correcte

L'IoU, ou intersection sur union, mesure le recouvrement entre la boîte prédite et la boîte annotée : l'aire de leur intersection divisée par l'aire de leur union. Une valeur de 1 correspond à une superposition parfaite, une valeur de 0 à une absence de recouvrement. Un seuil, fréquemment fixé à 0,5, décide si la prédiction compte comme vrai positif.

Ce seuil n'est pas un détail : une même détection peut être vrai positif à 0,5 et faux négatif à 0,75. Les petits objets, éclats ou impacts de gravillon, sont mécaniquement pénalisés, car quelques pixels de décalage y font chuter l'IoU bien plus vite que sur une grande zone enfoncée.

À retenir Une métrique de détection est un triplet : la valeur, le seuil de confiance et le seuil d'IoU. Communiquer la valeur seule revient à donner une distance sans préciser l'unité.

mAP@0.5 et mAP@0.5:0.95 : lire la métrique de référence

La précision moyenne, ou AP, est l'aire sous la courbe précision-rappel d'une classe donnée, obtenue en balayant tous les seuils de confiance. Le mAP est la moyenne des AP sur l'ensemble des classes de la taxonomie. C'est la métrique de référence pour comparer des modèles de détection.

Deux variantes circulent, et elles ne sont pas interchangeables :

  • mAP@0.5 : calculé à un seuil d'IoU unique de 0,50, indulgent sur la qualité du contour.
  • mAP@0.5:0.95 : moyenne des mAP calculés pour des seuils d'IoU de 0,50 à 0,95 par pas de 0,05. Beaucoup plus exigeant sur la localisation, il donne toujours une valeur nettement inférieure au mAP@0.5 pour un même modèle.

Deux conséquences pratiques. Comparer un mAP@0.5 annoncé par un fournisseur à un mAP@0.5:0.95 mesuré en interne n'a aucun sens. Et la moyenne entre classes dissimule les disparités : un modèle peut afficher un mAP honorable tout en échouant sur deux classes rares qui coûtent cher. Le détail par classe est plus informatif que l'agrégat.

Matrice de confusion et courbe précision-rappel

La matrice de confusion croise les classes réelles en lignes et les classes prédites en colonnes. La diagonale rassemble les bonnes réponses ; tout écart révèle une confusion entre classes. Une ligne et une colonne « fond » comptabilisent les dommages manqués et les détections inventées.

Son intérêt est diagnostique. Si les rayures profondes sont massivement prédites comme superficielles, le problème tient à la frontière entre deux classes, donc à la taxonomie ou au guide d'annotation des données d'inspection : aucune augmentation du volume d'entraînement ne corrigera une consigne ambiguë.

La courbe précision-rappel trace l'évolution conjointe des deux métriques lorsque le seuil de confiance varie. Chaque point est un réglage possible du système, ce qui permet de choisir un point de fonctionnement en connaissance de cause plutôt que de conserver un seuil par défaut.

Pourquoi un taux de précision annoncé seul ne veut rien dire

Un fournisseur qui annonce une « précision de 95 % » n'a rien communiqué d'évaluable. Six informations manquent, et chacune peut déplacer le résultat de plusieurs dizaines de points :

  1. Quel jeu de test ? Des photos d'atelier éclairées et des vidéos de parking souterrain ne produisent pas les mêmes chiffres.
  2. Quelle taxonomie ? Un modèle à trois classes larges devance mécaniquement un modèle à quinze classes fines.
  3. Quel seuil de confiance ? Le relever augmente la précision affichée et dégrade le rappel, sans qu'aucun modèle n'ait changé.
  4. Quel seuil d'IoU ? Les valeurs 0,5 et 0,75 racontent deux histoires différentes.
  5. Quelle unité de mesure ? Retrouver tous les dommages d'un véhicule est bien plus difficile qu'obtenir une bonne moyenne par image.
  6. Comment la vérité terrain a-t-elle été établie ? La qualité du référentiel d'annotation plafonne la qualité mesurée.

À retenir Un chiffre de performance ne se compare qu'à protocole identique. Exigez le jeu de test, la taxonomie, les seuils et le mode d'annotation avant toute comparaison entre deux solutions.

Le coût asymétrique des erreurs doit dicter le seuil

Le seuil de confiance est un curseur métier, pas un paramètre technique. L'abaisser augmente le rappel et dégrade la précision ; le relever produit l'effet inverse. Le bon réglage dépend du coût relatif des deux erreurs dans le processus concerné.

ContexteCoût d'un faux négatifCoût d'un faux positifOrientation du réglage
Restitution de véhicule en fin de contratDommage non facturé, perte sèche sur la remise en étatContestation du client, litige, coût de traitementRappel élevé, revue humaine systématique des cas facturables
Reprise d'un véhicule à distanceDécote non appliquée, marge érodée à la reventeOffre sous-évaluée, abandon du parcoursÉquilibre, avec arbitrage humain sur les dommages de forte valeur
Expertise d'assurance à distanceDommage préexistant non relevé, exposition au risqueInstruction inutile, temps d'expert mobiliséRappel privilégié, tri par score pour prioriser la revue

Dans la plupart des usages, un faux négatif coûte plus cher qu'un faux positif : un dommage manqué devient une perte financière ou un litige, alors qu'une fausse alerte est écartée en quelques secondes. Cette asymétrie plaide pour un seuil bas assorti d'un tri : détections très sûres acceptées, détections intermédiaires routées vers une revue humaine, détections faibles écartées. Ce principe structure les parcours d'expertise à distance en assurance, où le temps d'expert est la ressource rare.

La même logique vaut selon que le modèle tourne sur le terminal ou côté serveur : un modèle léger de guidage sera réglé pour le rappel, un modèle d'analyse plus lourd pour la précision.

Construire un jeu de test représentatif

La qualité de l'évaluation dépend du jeu de test. Quelques principes en conditionnent la validité :

  • Séparation par véhicule, pas par image. Deux images du même véhicule réparties entre entraînement et test gonflent artificiellement le score.
  • Distribution réaliste. Couleurs sombres et claires, carrosseries sales, parkings couverts, contre-jour, pluie, variété de terminaux mobiles.
  • Sous-ensemble dédié aux classes rares. Les défauts peu fréquents disparaissent d'un jeu aléatoire ; un sous-jeu spécifique permet de les mesurer séparément.
  • Annotation contrôlée. Double annotation puis arbitrage des désaccords, avec un guide écrit et versionné.
  • Jeu gelé. Il ne sert ni au réglage des hyperparamètres, ni à un enrichissement au fil des erreurs constatées.
  • Jeu adverse. Un lot volontairement difficile — reflets, salissures, autocollants, réparations antérieures — mesure la robustesse plutôt que la moyenne.

À retenir Le jeu de test est un actif à part entière : constitué, documenté et gelé avant toute mesure, il doit rester sous le contrôle de l'organisation qui évalue, non du fournisseur évalué.

Checklist des questions à poser à un fournisseur

Ces questions distinguent une mesure sérieuse d'un argument commercial :

  1. Sur quel jeu de test le chiffre a-t-il été obtenu, et comment ce jeu a-t-il été constitué ?
  2. Est-il strictement disjoint des données d'entraînement, au niveau du véhicule ?
  3. Quelle est la taxonomie complète, et quel est le score par classe ?
  4. À quels seuils de confiance et d'IoU les valeurs sont-elles calculées ?
  5. S'agit-il d'un mAP@0.5, d'un mAP@0.5:0.95, d'une précision ou d'un rappel ?
  6. La mesure est-elle faite par dommage, par image ou par véhicule complet ?
  7. Le modèle peut-il être évalué sur notre propre jeu de test, dans nos conditions réelles ?
  8. Comment la performance est-elle suivie en production, et selon quelle procédure de réentraînement ?

La dernière question est la plus révélatrice : un score de laboratoire se dégrade dès que le parc, les terminaux ou les conditions de prise de vue évoluent. Chez Lucius AI, ces métriques sont suivies par classe et par condition de capture plutôt que réduites à un indicateur unique, comme le détaille la page consacrée à notre technologie. Une évaluation sérieuse alimente enfin le calcul du retour sur investissement : c'est le taux de dossiers traités sans intervention humaine, et non le mAP, qui se traduit en euros. Pour échanger sur un protocole de test, vous pouvez nous contacter.

Questions fréquentes

Quelle différence entre précision et exactitude en détection d'objets ?

L'exactitude suppose de dénombrer les quatre cases d'une matrice, dont les vrais négatifs. En détection d'objets, les vrais négatifs ne sont pas dénombrables : une image contient une infinité de zones sans dommage. On utilise donc la précision, qui rapporte les détections correctes au total des détections émises, et le rappel, qui les rapporte au total des dommages réellement présents.

Que signifie concrètement un mAP@0.5:0.95 ?

C'est la moyenne des précisions moyennes calculées pour dix seuils d'IoU, de 0,50 à 0,95 par pas de 0,05, puis moyennée sur toutes les classes. Cette métrique récompense la finesse du contour autant que la bonne classification. Elle donne toujours une valeur sensiblement plus basse que le mAP@0.5 pour un même modèle, ce qui rend toute comparaison entre les deux trompeuse.

Faut-il privilégier la précision ou le rappel pour une inspection de véhicule ?

Cela dépend du coût des erreurs dans le processus concerné. Dans la plupart des usages d'inspection, un dommage manqué coûte plus cher qu'un dommage signalé à tort, car il se traduit par une perte financière ou un litige, tandis qu'une fausse alerte est écartée en quelques secondes. Le rappel est donc souvent privilégié, avec une revue humaine des cas incertains.

Pourquoi un modèle performant en laboratoire l'est-il moins en production ?

Parce que le jeu de test ne reflète jamais exactement la réalité d'exploitation : autres terminaux, autres conditions d'éclairage, autres couleurs de carrosserie, autres gestes de capture. Ce décalage de distribution dégrade mécaniquement les scores. La parade consiste à constituer un jeu de test issu des conditions réelles d'usage et à suivre la performance en continu après mise en service.

Quelle taille doit avoir un jeu de test d'inspection véhicule ?

Il n'existe pas de seuil universel. La contrainte utile porte sur les classes rares : chacune doit compter assez d'occurrences pour que son score ne dépende pas de quelques cas isolés. Un jeu qui contient beaucoup de véhicules mais deux exemples d'une classe donnée ne permet aucune conclusion sur cette classe, quel que soit son volume total.

Le seuil de confiance doit-il être le même pour toutes les classes ?

Pas nécessairement. Les classes n'ont ni la même difficulté visuelle ni le même coût métier. Un seuil par classe permet d'être plus permissif sur les dommages coûteux et difficiles à voir, et plus strict sur les classes sujettes aux fausses alertes, comme les confusions entre reflets et rayures sur carrosserie sombre.

Une question sur votre cas précis ?

Décrivez-nous votre parcours actuel : nous vous dirons franchement ce que l'IA peut y changer, et ce qu'elle ne changera pas.