Réussir au-delà des exercices connus

Surapprentissage et généralisation

Un modèle utile ne doit pas seulement réussir sur les données qui lui ont servi à apprendre. Il doit reconnaître les régularités qui restent valables face à des exemples nouveaux.

À retenirSurapprendre, c’est apprendre trop précisément l’entraînement. Généraliser, c’est rester utile sur des données nouvelles mais comparables.
Exercice connu20/20Le corrigé est mémorisé
≠
Nouveau problème?La méthode doit fonctionner

Trois situations

Trop simple, équilibré ou trop ajusté

Sous-apprentissage

Le modèle ne saisit pas assez

Il se trompe déjà sur les données d’entraînement. Le modèle, les informations ou l’entraînement sont insuffisants.

Surapprentissage

Il mémorise les détails et le bruit

L’entraînement paraît excellent, mais l’écart se creuse dès que les exemples changent.

L’écart qui révèle le problème

Comparez entraînement et données nouvelles

Bon équilibre

Les deux scores restent proches

Entraînement91 %

Test88 %

Diagnostic
Le modèle semble généraliser sur ce jeu de test.
Prochaine vérification
Tester des cas rares et surveiller les données réelles dans le temps.

Trois jeux, trois rôles

Pourquoi séparer les données ?

EntraînementApprendre

Ajuster les paramètres.

ValidationChoisir

Comparer les réglages et versions.

TestÉvaluer une dernière fois

Estimer la performance sur des exemples tenus à l’écart.

Attention aux fuites

Un test contaminé donne une fausse confiance

Si une même personne, un doublon ou une information issue du futur se retrouve des deux côtés, le modèle peut reconnaître l’exemple au lieu de généraliser.

  1. 1

    Séparer avant de préparer
    Éviter que des statistiques du test influencent l’entraînement.

  2. 2

    Garder les groupes ensemble
    Les données d’une même personne ne doivent pas être dispersées au hasard.

  3. 3

    Respecter le temps
    Pour prévoir demain, entraîner sur le passé et tester sur la suite.

  4. 4

    Comparer au terrain
    Un test propre reste seulement une approximation de la réalité.

Réduire le surapprentissage

Quatre leviers fréquents

1Données

Plus représentatives

Davantage d’exemples utiles, variés et correctement étiquetés.

2Simplicité

Moins de complexité inutile

Réduire des caractéristiques ou choisir un modèle plus sobre.

3Régularisation

Pénaliser les ajustements excessifs

Encourager une solution plus simple pendant l’entraînement.

4Arrêt

Ne pas entraîner trop longtemps

S’arrêter lorsque la validation cesse de s’améliorer.

Sources de référence

Pour approfondir

Google présente la généralisation comme la capacité à bien prédire sur des données nouvelles et montre comment la divergence des courbes peut révéler le surapprentissage.

Google for DevelopersSous-apprentissage, surapprentissage et généralisation →Google for DevelopersComplexité et régularisation →

Sources consultées le 28 septembre 2026.

Revoir le mécanisme

Revenez à la façon dont l’entraînement réduit la perte.

Perte et gradient

Dans le parcours « Je comprends comment les modèles apprennent »

Gardez le fil de votre apprentissage.

Une étape courte et clairement reliée à ce que vous venez de lire.