Représenter avec moins de précision

Qu’est-ce que la quantification d’un modèle d’IA ?

La quantification représente certains nombres d’un modèle avec moins de bits. Le modèle peut ainsi occuper moins de mémoire et parfois fonctionner plus vite, au prix d’approximations qu’il faut mesurer.

À retenirOn conserve le modèle, mais on range certains de ses nombres dans des cases moins nombreuses.
Valeur précise0,738 421→Valeur quantifiée0,74Illustration simplifiée : les méthodes réelles utilisent une échelle et parfois un point zéro.

Comparez trois précisions

Moins de bits, moins de mémoire… mais plus d’approximation

Choisissez une représentation. Les tailles et écarts sont illustratifs pour un même modèle hypothétique.

Comment cela fonctionne

Une plage de valeurs est projetée sur moins de niveaux

Une échelle relie les nombres d’origine aux valeurs disponibles dans le format réduit. Chaque nombre est arrondi vers un niveau proche, puis peut être reconverti en approximation pour le calcul.

Exemple simplifié : si seulement cinq niveaux sont disponibles, 0,73 peut devenir 0,75. L’écart est petit isolément, mais leurs effets s’additionnent dans le modèle.

−1−0,500,51Beaucoup de valeurs d’origine → quelques niveaux représentables

Que peut-on quantifier ?

Les poids, les activations ou les deux

Poids

Les valeurs apprises

Les stocker avec moins de bits réduit directement la mémoire nécessaire au modèle.

Activations

Les valeurs intermédiaires

Elles sont produites pendant l’inférence et peuvent aussi être quantifiées.

Calcul

Le matériel compte

Le gain dépend des opérations réellement prises en charge par le processeur ou l’accélérateur.

Quand réduire la précision ?

Après l’entraînement ou pendant celui-ci

PTQ

Après l’entraînement

On convertit un modèle déjà entraîné. Une calibration avec des données représentatives peut aider à choisir les plages.

Plus simple, mais la perte peut augmenter aux très faibles précisions.
QAT

Entraînement conscient de la quantification

On simule les arrondis pendant l’entraînement afin que le modèle apprenne à mieux les supporter.

Plus exigeant, mais souvent plus robuste.

Les gains possibles

Charger, déplacer et calculer plus légèrement

Modèle plus petit

Moins d’espace de stockage et de mémoire vive.

Inférence plus rapide

Si le matériel accélère le format choisi.

Appareil local

Un modèle peut tenir sur un équipement plus limité.

Énergie et coût

Moins de transferts et de calcul peuvent réduire les ressources.

Ne pas confondre

La quantification ne change pas tout le modèle

Quantification

Réduit la précision

Représente les nombres existants avec moins de bits.

Distillation

Entraîne un élève

Crée un autre modèle qui imite un professeur.

Élagage

Retire des éléments

Supprime certains poids ou structures.

Compression de fichier

Réduit le stockage

Ne garantit pas un calcul plus rapide après décompression.

Les limites

Le plus petit format n’est pas toujours le meilleur

Qualité dégradée

Les arrondis peuvent modifier des prédictions ou la génération.

Matériel incompatible

Sans opérations adaptées, le gain peut être faible ou négatif.

Cas sensibles

Certaines couches ou tâches supportent moins bien la réduction.

Mesures trompeuses

Taille, vitesse et qualité doivent être testées sur le même matériel et les mêmes données.

Avant de choisir

Six questions pour évaluer une quantification

  1. 01

    Quel matériel ?
    CPU, GPU, mobile ou autre accélérateur ?

  2. 02

    Quels nombres ?
    Poids seuls ou activations aussi ?

  3. 03

    Quelle méthode ?
    Après entraînement, calibration ou QAT ?

  4. 04

    Quel gain réel ?
    Taille, latence, débit et énergie.

  5. 05

    Quelle perte ?
    Évaluer sur des cas normaux et difficiles.

  6. 06

    Quel retour arrière ?
    Conserver une référence non quantifiée.

Sources de référence

Pour approfondir

Ces documentations expliquent les principes, les méthodes et les limites matérielles de la quantification.

Hugging Face TransformersConcepts de quantification →PyTorchRecette de quantification →ONNX RuntimeQuantifier et optimiser un modèle →

Sources consultées le 28 septembre 2026.

Relier les notions

Comparez avec la distillation, qui entraîne un nouveau modèle élève.

Comprendre la distillation

Comprendre une notion

Gardez le fil de votre apprentissage.

Une étape courte et clairement reliée à ce que vous venez de lire.