Quand 80 % doit ressembler à 80 %

Qu’est-ce qu’un modèle bien calibré ?

Parmi de nombreuses prédictions annoncées autour de 80 %, environ 80 % devraient réellement se produire. La calibration vérifie cette correspondance entre les probabilités annoncées et les fréquences observées.

À retenirUn modèle peut bien classer les cas tout en étant trop sûr de lui — ou au contraire trop prudent.
100 cas annoncés à80 %

≈ 80 devraient être réellement positifs

Trois comportements

Trop sûr, bien calibré ou trop prudent

Surconfiant

Annonce 90 %, réussit 65 %

Le nombre inspire plus de confiance que les résultats ne le permettent.

Sous-confiant

Annonce 55 %, réussit 80 %

Le modèle distingue peut-être bien les cas mais minimise sa fiabilité.

Le diagramme de fiabilité

Comparer prédiction et réalité par groupes

On rassemble les prédictions proches — par exemple celles entre 70 et 80 % — puis on calcule la proportion réellement positive. Un modèle bien calibré se rapproche de la diagonale idéale.

Fréquence réelleProbabilité annoncée →

Deux qualités distinctes

Calibration et discrimination ne répondent pas à la même question

Discrimination

Le modèle classe-t-il les positifs devant les négatifs ?

Il peut très bien ordonner les cas tout en donnant de mauvaises probabilités.

Recalibrer proprement

Utiliser des données séparées

1Entraîner

Apprendre le modèle

Sans utiliser les données réservées à la calibration.

2Observer

Comparer scores et résultats

Sur des exemples nouveaux et représentatifs.

3Corriger

Apprendre une transformation

Associer les scores bruts à de meilleures probabilités.

4Surveiller

Recontrôler dans le temps

Une dérive peut aussi détériorer la calibration.

Ce qui peut tromper

Un bon graphique ne vaut que pour son contexte

  1. 1

    Trop peu de cas
    Les fréquences deviennent instables dans chaque groupe.

  2. 2

    Données différentes
    La calibration peut changer selon la population ou la période.

  3. 3

    Groupes trop larges
    Ils masquent des écarts importants à l’intérieur.

  4. 4

    Score sans catégorie claire
    Une similarité ou un logit n’est pas automatiquement une probabilité.

Sources techniques

Pour vérifier et approfondir

Ces références expliquent la correspondance entre probabilités annoncées et fréquences réelles, ainsi que l’intérêt de probabilités interprétables pour contrôler un modèle en production.

scikit-learnCalibration des probabilités et courbes de fiabilité →Google for DevelopersBonnes pratiques pour des prédictions probabilistes →

Sources consultées le 28 septembre 2026.

Repérer l’inhabituel

Certains systèmes cherchent non pas une catégorie, mais un écart à la normale.

Détection d’anomalies

Comprendre une notion

Gardez le fil de votre apprentissage.

Une étape courte et clairement reliée à ce que vous venez de lire.