Transmettre à un modèle plus léger

Qu’est-ce que la distillation d’un modèle d’IA ?

La distillation entraîne un modèle « élève » à reproduire une partie du comportement d’un modèle « professeur », généralement plus grand. L’objectif est souvent d’obtenir un modèle plus petit, plus rapide ou moins coûteux à utiliser.

À retenirL’élève imite des sorties du professeur : il ne reçoit ni ses poids, ni une copie parfaite de toutes ses capacités.
Professeurgrand modèle entraînéproduit des réponses détaillées
enseigne →
Élèvemodèle plus petitapprend à s’en approcher

Regardez ce qui est transmis

Une étiquette dit moins qu’une distribution

Les probabilités sont fictives. Elles montrent pourquoi les sorties du professeur peuvent apprendre davantage à l’élève qu’une seule bonne réponse.

Le mécanisme

Le professeur est fixé, l’élève s’ajuste

Les mêmes exemples sont présentés aux deux modèles. Une fonction de perte mesure l’écart entre leurs sorties, parfois combiné avec les véritables étiquettes. Seuls les paramètres de l’élève sont mis à jour.

  1. 1

    Le professeur répond
    Il produit des scores ou une génération.

  2. 2

    L’élève répond
    Avec sa capacité plus limitée.

  3. 3

    On compare
    L’écart devient un signal d’apprentissage.

  4. 4

    L’élève s’ajuste
    Le professeur reste inchangé.

Pourquoi « adoucir » les scores ?

Les petites probabilités contiennent aussi de l’information

Une température appliquée pendant l’entraînement peut rendre la distribution moins tranchée. Les rapports entre classes secondaires deviennent plus visibles et donnent un signal plus riche à l’élève.

Ce n’est pas la température de génération. Le mot est similaire, mais il sert ici à préparer les sorties utilisées pour entraîner l’élève.

Distribution tranchée

chat 96 %renard 3 %chien 1 %

Distribution adoucie

chat 62 %renard 24 %chien 14 %

Pourquoi le faire ?

Rendre l’inférence plus légère

Moins de mémoire

Un élève plus petit peut être plus facile à charger sur un appareil.

Réponses plus rapides

Moins de calcul peut réduire la latence.

Coût réduit

Servir de nombreuses demandes peut demander moins de ressources.

Usage local

Certains élèves peuvent fonctionner sur mobile ou matériel limité.

Ne pas tout mélanger

Quatre techniques, quatre objectifs

Distillation

Imiter un professeur

Entraîne un autre modèle à rapprocher ses sorties.

Quantification

Réduire la précision des nombres

Allège souvent un modèle existant sans professeur.

Élagage

Retirer des éléments

Supprime certains poids ou structures jugés moins utiles.

Fine-tuning

Spécialiser un modèle

Ajuste son comportement à une tâche ou à des exemples ciblés.

Les compromis

Plus petit ne veut pas dire équivalent

Capacité réduite

L’élève peut perdre en précision, en nuance ou en polyvalence.

Biais transmis

Il peut reproduire les erreurs et préférences du professeur.

Couverture incomplète

Il n’imite correctement que les situations montrées pendant la distillation.

Évaluation indispensable

Le gain de vitesse doit être comparé aux pertes sur les cas réels et sensibles.

Évaluer un modèle distillé

Six questions avant de le déployer

  1. 01

    Quel professeur ?
    Qualité, limites et droits d’usage.

  2. 02

    Quelles données ?
    Représentent-elles les situations réelles ?

  3. 03

    Que doit conserver l’élève ?
    Une tâche précise ou plusieurs capacités ?

  4. 04

    Quel gain mesuré ?
    Taille, latence, débit, énergie et coût.

  5. 05

    Quelle perte de qualité ?
    Comparer sur un jeu de test séparé.

  6. 06

    Quels cas sensibles ?
    Tester erreurs rares, biais et sécurité.

Sources de référence

Pour approfondir

Ces ressources présentent la méthode professeur–élève et une implémentation pédagogique classique.

Hinton, Vinyals et DeanArticle fondateur sur la distillation →KerasExemple de distillation professeur–élève →Google for DevelopersFine-tuning, distillation et inférence →

Sources consultées le 28 septembre 2026.

Relier les notions

Voyez où le modèle élève sera réellement utilisé.

Comprendre l’inférence

Comprendre une notion

Gardez le fil de votre apprentissage.

Une étape courte et clairement reliée à ce que vous venez de lire.