Trois façons de recevoir un retour

Supervisé, non supervisé ou par renforcement ?

Ces mots ne décrivent pas trois niveaux d’intelligence. Ils indiquent surtout quel signal guide l’apprentissage : une bonne réponse connue, des ressemblances à découvrir ou une récompense obtenue après une action.

À retenirLa bonne famille dépend du problème, des données disponibles et du type de retour que l’on peut fournir.
RéponseSupervisé
StructureNon supervisé
RécompenseRenforcement

La différence en un regard

Ce que le modèle reçoit pour progresser

Non supervisé

Des exemples sans réponse imposée

Le système cherche des structures, des proximités ou des groupes. Une personne doit ensuite interpréter ce qu’ils signifient.

Renforcement

Des actions, puis une récompense

Un agent essaie une stratégie dans un environnement. Les conséquences favorables ou défavorables orientent les choix futurs.

À vous de choisir

Trois exemples très simples

Avec des courriels déjà étiquetés « indésirable » ou « normal », le modèle apprend de façon supervisée. En regroupant des clients sans catégories fournies, il travaille sans supervision. En apprenant à gagner à un jeu grâce à des récompenses et pénalités, il utilise l’apprentissage par renforcement.

Quel apprentissage pour quel problème ?

Choisissez une situation. Le signal disponible donne l’indice essentiel.

Réponses connues

Apprentissage supervisé

Signal
Chaque message possède déjà une étiquette.
Ce qui est appris
La relation entre le contenu d’un message et sa catégorie.
À contrôler
Les exemples mal étiquetés et les nouveaux types de spam.

Les pièges de vocabulaire

Trois idées à ne pas mélanger

  1. 1

    Supervisé ne signifie pas surveillé en direct.
    La « supervision » vient des réponses attachées aux exemples.

  2. 2

    Non supervisé ne signifie pas sans humains.
    Il faut choisir les données, la méthode et interpréter les groupes.

  3. 3

    Une récompense n’est pas une valeur morale.
    Le système optimise le signal défini, même s’il est incomplet.

  4. 4

    Les familles peuvent se combiner.
    Un même produit peut utiliser plusieurs phases et plusieurs signaux.

Le bon réflexe

Commencer par la question, pas par la technique

1Objectif

Que doit produire le système ?

Une valeur, une catégorie, des groupes ou une suite d’actions ?

2Données

Dispose-t-on de réponses fiables ?

Les étiquettes peuvent être rares, coûteuses ou ambiguës.

3Retour

Comment saura-t-il qu’il progresse ?

Erreur mesurée, cohérence des groupes ou récompense.

4Évaluation

Comment tester le résultat ?

Sur des situations nouvelles et des cas difficiles, pas seulement connus.

Source de référence

Pour approfondir

Le cours d’introduction de Google distingue ces familles par la nature du signal utilisé pour apprendre.

Google for DevelopersLes types de systèmes d’apprentissage automatique →Google for DevelopersLes bases de l’apprentissage supervisé →

Sources consultées le 28 septembre 2026.

Étape suivante

Regardez maintenant ce que le modèle peut produire.

Classification, régression, génération

Dans le parcours « Je comprends comment les modèles apprennent »

Gardez le fil de votre apprentissage.

Une étape courte et clairement reliée à ce que vous venez de lire.