Réussir au-delà des exercices connus
Surapprentissage et généralisation
Un modèle utile ne doit pas seulement réussir sur les données qui lui ont servi à apprendre. Il doit reconnaître les régularités qui restent valables face à des exemples nouveaux.
Trois situations
Trop simple, équilibré ou trop ajusté
Le modèle ne saisit pas assez
Il se trompe déjà sur les données d’entraînement. Le modèle, les informations ou l’entraînement sont insuffisants.
Il apprend une régularité utile
Les performances restent bonnes sur des données de validation, de test puis sur le terrain.
Il mémorise les détails et le bruit
L’entraînement paraît excellent, mais l’écart se creuse dès que les exemples changent.
L’écart qui révèle le problème
Comparez entraînement et données nouvelles
Les deux scores restent proches
Entraînement91 %
Test88 %
- Diagnostic
- Le modèle semble généraliser sur ce jeu de test.
- Prochaine vérification
- Tester des cas rares et surveiller les données réelles dans le temps.
Trois jeux, trois rôles
Pourquoi séparer les données ?
Ajuster les paramètres.
Comparer les réglages et versions.
Estimer la performance sur des exemples tenus à l’écart.
Attention aux fuites
Un test contaminé donne une fausse confiance
Si une même personne, un doublon ou une information issue du futur se retrouve des deux côtés, le modèle peut reconnaître l’exemple au lieu de généraliser.
- 1
Séparer avant de préparer
Éviter que des statistiques du test influencent l’entraînement. - 2
Garder les groupes ensemble
Les données d’une même personne ne doivent pas être dispersées au hasard. - 3
Respecter le temps
Pour prévoir demain, entraîner sur le passé et tester sur la suite. - 4
Comparer au terrain
Un test propre reste seulement une approximation de la réalité.
Réduire le surapprentissage
Quatre leviers fréquents
Plus représentatives
Davantage d’exemples utiles, variés et correctement étiquetés.
Moins de complexité inutile
Réduire des caractéristiques ou choisir un modèle plus sobre.
Pénaliser les ajustements excessifs
Encourager une solution plus simple pendant l’entraînement.
Ne pas entraîner trop longtemps
S’arrêter lorsque la validation cesse de s’améliorer.
Sources de référence
Pour approfondir
Google présente la généralisation comme la capacité à bien prédire sur des données nouvelles et montre comment la divergence des courbes peut révéler le surapprentissage.
Sources consultées le 28 septembre 2026.
Revoir le mécanisme
Revenez à la façon dont l’entraînement réduit la perte.
Dans le parcours « Je comprends comment les modèles apprennent »
Gardez le fil de votre apprentissage.
Une étape courte et clairement reliée à ce que vous venez de lire.