Influe fortement sur le stockage, la mémoire et le déploiement.
Activer seulement une partie du modèle
Qu’est-ce qu’un modèle Mixture of Experts ?
Un modèle Mixture of Experts, ou MoE, contient plusieurs groupes de paramètres appelés « experts ». Un routeur choisit lesquels activer pour chaque token.
2 experts actifs sur 6
Suivez le routeur
Chaque token peut emprunter un chemin différent
Choisissez un token. Le routage ci-dessous est une illustration pédagogique, pas la description d’un modèle précis.
À l’intérieur d’une couche
Activer seulement quelques experts réduit certains calculs, mais tous les paramètres doivent souvent rester disponibles en mémoire. Le routeur peut aussi surcharger certains experts ou mal répartir les requêtes. Le gain dépend donc du matériel, du logiciel et de l’équilibre obtenu pendant l’entraînement.
Router, calculer, combiner
Dans un Transformer MoE, certaines couches denses sont remplacées par plusieurs sous-réseaux. Le routeur produit des scores, sélectionne les meilleurs experts — souvent un ou deux — puis combine leurs résultats.
- 01
Représenter le token
Le modèle dispose d’un vecteur tenant compte du contexte. - 02
Calculer les scores
Le routeur évalue les experts disponibles. - 03
Activer le top-k
Seuls les experts retenus traitent ce token. - 04
Combiner
Leurs sorties pondérées poursuivent le réseau.
Deux nombres à distinguer
Paramètres totaux et paramètres actifs
La taille totale décrit tout ce qu’il faut stocker. La taille active indique approximativement la partie utilisée pour traiter un token. Comparer un MoE à un modèle dense exige de regarder les deux.
Influe davantage sur le calcul réalisé pour chaque token.
Un nom trompeur
Un « expert » n’est pas forcément un spécialiste identifiable
Les experts apprennent pendant l’entraînement. Certains peuvent développer des préférences pour des formes de tokens ou des types de contexte, mais il serait abusif de les présenter systématiquement comme « expert en droit », « expert en français » ou « expert en maths ».
Le routeur apprend à répartir les tokens entre des sous-réseaux.
Ce qu’il faut vérifierLa spécialisation réelle, sa stabilité et son interprétabilité.
Pourquoi utiliser un MoE ?
Augmenter la capacité sans activer tout le calcul
Davantage de paramètres peuvent apprendre des comportements variés.
Chaque token n’active qu’une fraction des experts.
La capacité peut augmenter à budget de calcul actif maîtrisé.
Une bonne distribution peut servir de nombreux tokens efficacement.
Les contreparties
Le calcul baisse, mais la complexité se déplace
Tous les experts doivent être stockés et souvent disponibles rapidement.
Les tokens peuvent circuler entre plusieurs puces ou machines.
Un expert trop demandé crée un embouteillage tandis que d’autres restent sous-utilisés.
Le routeur et les experts doivent apprendre ensemble sans s’effondrer sur quelques chemins.
Ne pas confondre
Le MoE n’est pas une équipe d’agents
Des sous-réseaux internes
Le routage se produit dans le calcul du modèle, souvent token par token.
Des acteurs logiciels
Plusieurs agents peuvent dialoguer, planifier et utiliser des outils.
Plusieurs prédictions
Des modèles complets produisent des résultats ensuite agrégés.
Des documents retrouvés
Le modèle reçoit des informations externes dans son contexte.
Pour comparer honnêtement
Six questions à poser
- 01
Combien d’experts ?
Nombre total de sous-réseaux disponibles. - 02
Combien sont actifs ?
Top-1, top-2 ou davantage par token. - 03
Combien de paramètres ?
Distinguer le total et l’actif. - 04
Quelle mémoire ?
Inclure tous les experts à charger. - 05
Quelle infrastructure ?
Mesurer communications et équilibrage. - 06
Quel résultat réel ?
Qualité, latence, débit, coût et énergie.
Sources de référence
Pour approfondir
Ces publications décrivent le routage sparse, ses avantages et ses difficultés pratiques.
Sources consultées le 28 septembre 2026.
Relier les notions
Revenez aux paramètres, les valeurs apprises réparties dans le modèle.
Comprendre une notion
Gardez le fil de votre apprentissage.
Une étape courte et clairement reliée à ce que vous venez de lire.