Activer seulement une partie du modèle

Qu’est-ce qu’un modèle Mixture of Experts ?

Un modèle Mixture of Experts, ou MoE, contient plusieurs groupes de paramètres appelés « experts ». Un routeur choisit lesquels activer pour chaque token.

À retenirBeaucoup de paramètres peuvent être disponibles, sans qu’ils travaillent tous en même temps.
tokenRouteur
123456

2 experts actifs sur 6

Suivez le routeur

Chaque token peut emprunter un chemin différent

Choisissez un token. Le routage ci-dessous est une illustration pédagogique, pas la description d’un modèle précis.

À l’intérieur d’une couche

Les limites d’un modèle MoE

Activer seulement quelques experts réduit certains calculs, mais tous les paramètres doivent souvent rester disponibles en mémoire. Le routeur peut aussi surcharger certains experts ou mal répartir les requêtes. Le gain dépend donc du matériel, du logiciel et de l’équilibre obtenu pendant l’entraînement.

Router, calculer, combiner

Dans un Transformer MoE, certaines couches denses sont remplacées par plusieurs sous-réseaux. Le routeur produit des scores, sélectionne les meilleurs experts — souvent un ou deux — puis combine leurs résultats.

  1. 01

    Représenter le token
    Le modèle dispose d’un vecteur tenant compte du contexte.

  2. 02

    Calculer les scores
    Le routeur évalue les experts disponibles.

  3. 03

    Activer le top-k
    Seuls les experts retenus traitent ce token.

  4. 04

    Combiner
    Leurs sorties pondérées poursuivent le réseau.

Deux nombres à distinguer

Paramètres totaux et paramètres actifs

La taille totale décrit tout ce qu’il faut stocker. La taille active indique approximativement la partie utilisée pour traiter un token. Comparer un MoE à un modèle dense exige de regarder les deux.

TotalTout le modèle

Influe fortement sur le stockage, la mémoire et le déploiement.

ActifsLe chemin choisi

Influe davantage sur le calcul réalisé pour chaque token.

Un nom trompeur

Un « expert » n’est pas forcément un spécialiste identifiable

Les experts apprennent pendant l’entraînement. Certains peuvent développer des préférences pour des formes de tokens ou des types de contexte, mais il serait abusif de les présenter systématiquement comme « expert en droit », « expert en français » ou « expert en maths ».

Ce que l’on sait

Le routeur apprend à répartir les tokens entre des sous-réseaux.

Ce qu’il faut vérifier

La spécialisation réelle, sa stabilité et son interprétabilité.

Pourquoi utiliser un MoE ?

Augmenter la capacité sans activer tout le calcul

Capacité accrue

Davantage de paramètres peuvent apprendre des comportements variés.

Calcul conditionnel

Chaque token n’active qu’une fraction des experts.

Entraînement à grande échelle

La capacité peut augmenter à budget de calcul actif maîtrisé.

Débit potentiel

Une bonne distribution peut servir de nombreux tokens efficacement.

Les contreparties

Le calcul baisse, mais la complexité se déplace

Mémoire

Tous les experts doivent être stockés et souvent disponibles rapidement.

Communication

Les tokens peuvent circuler entre plusieurs puces ou machines.

Équilibrage

Un expert trop demandé crée un embouteillage tandis que d’autres restent sous-utilisés.

Entraînement instable

Le routeur et les experts doivent apprendre ensemble sans s’effondrer sur quelques chemins.

Ne pas confondre

Le MoE n’est pas une équipe d’agents

MoE

Des sous-réseaux internes

Le routage se produit dans le calcul du modèle, souvent token par token.

Système multi-agents

Des acteurs logiciels

Plusieurs agents peuvent dialoguer, planifier et utiliser des outils.

Ensemble de modèles

Plusieurs prédictions

Des modèles complets produisent des résultats ensuite agrégés.

RAG

Des documents retrouvés

Le modèle reçoit des informations externes dans son contexte.

Pour comparer honnêtement

Six questions à poser

  1. 01

    Combien d’experts ?
    Nombre total de sous-réseaux disponibles.

  2. 02

    Combien sont actifs ?
    Top-1, top-2 ou davantage par token.

  3. 03

    Combien de paramètres ?
    Distinguer le total et l’actif.

  4. 04

    Quelle mémoire ?
    Inclure tous les experts à charger.

  5. 05

    Quelle infrastructure ?
    Mesurer communications et équilibrage.

  6. 06

    Quel résultat réel ?
    Qualité, latence, débit, coût et énergie.

Sources de référence

Pour approfondir

Ces publications décrivent le routage sparse, ses avantages et ses difficultés pratiques.

Switch Transformers — JMLRArticle de recherche →Google ResearchExpert Choice Routing →Mistral AIExemple concret avec Mixtral →

Sources consultées le 28 septembre 2026.

Relier les notions

Revenez aux paramètres, les valeurs apprises réparties dans le modèle.

Comprendre les paramètres

Comprendre une notion

Gardez le fil de votre apprentissage.

Une étape courte et clairement reliée à ce que vous venez de lire.