Les valeurs apprises
Les stocker avec moins de bits réduit directement la mémoire nécessaire au modèle.
Représenter avec moins de précision
La quantification représente certains nombres d’un modèle avec moins de bits. Le modèle peut ainsi occuper moins de mémoire et parfois fonctionner plus vite, au prix d’approximations qu’il faut mesurer.
Comparez trois précisions
Choisissez une représentation. Les tailles et écarts sont illustratifs pour un même modèle hypothétique.
Comment cela fonctionne
Une échelle relie les nombres d’origine aux valeurs disponibles dans le format réduit. Chaque nombre est arrondi vers un niveau proche, puis peut être reconverti en approximation pour le calcul.
Exemple simplifié : si seulement cinq niveaux sont disponibles, 0,73 peut devenir 0,75. L’écart est petit isolément, mais leurs effets s’additionnent dans le modèle.
Que peut-on quantifier ?
Les stocker avec moins de bits réduit directement la mémoire nécessaire au modèle.
Elles sont produites pendant l’inférence et peuvent aussi être quantifiées.
Le gain dépend des opérations réellement prises en charge par le processeur ou l’accélérateur.
Quand réduire la précision ?
On convertit un modèle déjà entraîné. Une calibration avec des données représentatives peut aider à choisir les plages.
Plus simple, mais la perte peut augmenter aux très faibles précisions.On simule les arrondis pendant l’entraînement afin que le modèle apprenne à mieux les supporter.
Plus exigeant, mais souvent plus robuste.Les gains possibles
Moins d’espace de stockage et de mémoire vive.
Si le matériel accélère le format choisi.
Un modèle peut tenir sur un équipement plus limité.
Moins de transferts et de calcul peuvent réduire les ressources.
Ne pas confondre
Représente les nombres existants avec moins de bits.
Crée un autre modèle qui imite un professeur.
Supprime certains poids ou structures.
Ne garantit pas un calcul plus rapide après décompression.
Les limites
Les arrondis peuvent modifier des prédictions ou la génération.
Sans opérations adaptées, le gain peut être faible ou négatif.
Certaines couches ou tâches supportent moins bien la réduction.
Taille, vitesse et qualité doivent être testées sur le même matériel et les mêmes données.
Avant de choisir
Quel matériel ?
CPU, GPU, mobile ou autre accélérateur ?
Quels nombres ?
Poids seuls ou activations aussi ?
Quelle méthode ?
Après entraînement, calibration ou QAT ?
Quel gain réel ?
Taille, latence, débit et énergie.
Quelle perte ?
Évaluer sur des cas normaux et difficiles.
Quel retour arrière ?
Conserver une référence non quantifiée.
Sources de référence
Ces documentations expliquent les principes, les méthodes et les limites matérielles de la quantification.
Sources consultées le 28 septembre 2026.
Relier les notions
Comprendre une notion
Une étape courte et clairement reliée à ce que vous venez de lire.