Toutes les erreurs ne se valent pas

Précision, rappel et matrice de confusion

Dire qu’un modèle a « 95 % de réussite » cache parfois l’essentiel. Pour juger une classification, il faut regarder ce qu’il détecte, ce qu’il manque et les fausses alertes qu’il déclenche.

Question décisiveDans votre situation, est-il plus grave de manquer un cas positif ou de déclencher une fausse alerte ?
99 %d’exactitude

…même pour un modèle qui répond toujours « non » lorsque le cas recherché n’apparaît qu’une fois sur cent.

Les quatre résultats possibles

La matrice de confusion

« Positif » désigne la catégorie recherchée. « Vrai » ou « faux » indique si la prédiction correspond à la réalité.

Réel positif
Réel négatif
Prédit positif
Vrai positifDétection correcte
Faux positifFausse alerte
Prédit négatif
Faux négatifCas manqué
Vrai négatifRejet correct

Trois questions différentes

Exemple : filtrer 1 000 courriels

Parmi 100 véritables spams, le filtre en repère 80 et en laisse passer 20. Il classe aussi 20 messages légitimes comme spams. Sa précision est de 80 sur 100 alertes, soit 80 %, et son rappel de 80 sur 100 spams réels, soit également 80 %. Les deux mesures racontent des erreurs différentes.

Exactitude, précision et rappel

Exactitude

Combien de réponses sont justes au total ?

Utile comme vue générale si les catégories sont équilibrées. Trompeuse lorsque le cas positif est rare.

Rappel

Parmi les cas réels, combien sont détectés ?

À privilégier lorsqu’un cas manqué a de lourdes conséquences.

Choisir selon le risque

Quelle mesure regarder d’abord ?

Cas manqués très coûteux

Priorité au rappel

Question
Parmi les personnes réellement malades, combien sont repérées ?
Compromis
Accepter davantage de faux positifs, ensuite contrôlés par un examen.
Ne pas oublier
Le seuil et le protocole médical doivent être validés par des spécialistes.

Le rôle du seuil

Transformer un score en décision

Le modèle peut produire « 72 % positif ». L’application doit ensuite choisir à partir de quel score elle déclenche l’action. Baisser ce seuil détecte généralement plus de cas, mais provoque plus de fausses alertes.

0 %Seuil100 %

Plus bas : rappel ↑, fausses alertes ↑

Plus haut : précision souvent ↑, cas manqués ↑

Lire un score honnêtement

Toujours demander le contexte

  1. 1

    Sur quelles données ?
    Le test représente-t-il la population et la situation réelles ?

  2. 2

    À quel seuil ?
    Les métriques changent lorsque la décision change.

  3. 3

    Pour quels groupes ?
    Une moyenne peut masquer de forts écarts.

  4. 4

    Avec quelles conséquences ?
    Relier chaque erreur à son impact humain concret.

Sources de référence

Pour approfondir

Google définit ces mesures à partir des vrais et faux positifs et négatifs, et rappelle que leur pertinence dépend du coût des erreurs et de l’équilibre des catégories.

Google for DevelopersSeuil et matrice de confusion →Google for DevelopersExactitude, précision et rappel →

Sources consultées le 28 septembre 2026.

Après le lancement

Une bonne mesure aujourd’hui ne garantit pas la qualité demain.

Dérive et surveillance

Dans le parcours « Je comprends comment les modèles apprennent »

Gardez le fil de votre apprentissage.

Une étape courte et clairement reliée à ce que vous venez de lire.