Une architecture qui relie les éléments d’une séquence

Qu’est-ce qu’un Transformer ?

Un Transformer est une architecture de réseau de neurones qui utilise l’attention pour pondérer les relations entre les éléments d’un contexte. Elle équipe de nombreux modèles de langage modernes.

Idée centraleChaque token peut examiner les autres tokens disponibles et leur accorder une importance différente.
Lacléestprèsdulivrerouillée« rouillée » se relie fortement à « clé »

Observez l’attention

Une fin de phrase peut changer les relations

Les scores ci-dessous sont fictifs. Ils illustrent le principe, pas les calculs d’un modèle réel.

Préparer la séquence

Le modèle combine contenu et position

Avant l’attention, le texte est découpé en tokens. Chacun devient un embedding, puis reçoit une information de position pour distinguer l’ordre des éléments.

Pourquoi la position compte ? « Le chat poursuit la souris » n’a pas le même sens que « La souris poursuit le chat ».

Tokenchatun morceau de texte
+
Embedding[0,18 ; −0,52 ; …]une représentation numérique
+
Positionn° 2sa place dans la séquence

Question, clé, valeur

Chaque token cherche les informations qui lui sont utiles

L’auto-attention crée plusieurs représentations pour chaque token. Une requête est comparée aux clés des autres tokens ; les scores obtenus servent à combiner leurs valeurs.

Q

Requête

« Que dois-je chercher pour interpréter ce token ? »

K

Clé

« Quel type d’information ce token peut-il apporter ? »

V

Valeur

« Quelle information transmettre si le lien est important ? »

Plusieurs regards en parallèle

Les têtes d’attention peuvent apprendre des relations différentes

Un bloc comporte généralement plusieurs têtes. Certaines peuvent privilégier des relations grammaticales, des positions, des références ou d’autres motifs appris. Leurs résultats sont combinés puis transformés.

Tête Apronom ↔ nomréférence possible
Tête Bverbe ↔ sujetrelation grammaticale
Tête Cmot ↔ contextesens dans la phrase
Couche suivantecombine et affineune représentation plus riche

Trois grandes familles

Encoder, décodeur ou les deux

Encoder

Comprendre une entrée

Examine souvent les deux côtés du contexte pour créer des représentations, classer ou rechercher.

Décodeur

Générer une suite

Utilise les tokens précédents sans regarder les futurs tokens qu’il n’a pas encore produits.

Encoder + décodeur

Transformer une séquence

L’un représente l’entrée, l’autre produit la sortie, par exemple pour traduire.

Pourquoi cette architecture a compté

Relier des éléments éloignés et mieux paralléliser l’entraînement

Contrairement aux anciens réseaux qui lisaient surtout les éléments l’un après l’autre, le Transformer peut calculer de nombreuses relations en parallèle. Cela a facilité l’entraînement sur de grands volumes et la prise en compte de contextes plus riches.

Traitement séquentiel

A → puis B → puis C → puis D

les étapes dépendent fortement les unes des autres
Transformer

A ↔ B ↔ C ↔ D

de nombreuses relations sont calculées ensemble

Les limites à connaître

L’attention n’est ni une mémoire parfaite ni une explication complète

Le calcul augmente vite

L’attention classique compare de nombreuses paires de positions ; un long contexte demande plus de mémoire et de calcul.

Un score n’est pas une preuve

Une carte d’attention ne suffit pas toujours à expliquer pourquoi le modèle a produit sa réponse.

Le contexte reste borné

Ce qui dépasse la fenêtre disponible ou ce qui est mal représenté peut être perdu.

Les erreurs restent possibles

Mieux relier les tokens n’empêche ni hallucinations, ni biais, ni mauvaise interprétation.

Quand on vous présente un Transformer

Six questions pour dépasser le mot technique

  1. 01

    Pour quelle entrée ?
    Texte, image, audio et vidéo ne sont pas préparés de la même façon.

  2. 02

    Encoder ou décodeur ?
    L’architecture dépend du rôle attendu.

  3. 03

    Quelle longueur de contexte ?
    La taille annoncée ne garantit pas une utilisation parfaite.

  4. 04

    Quel coût ?
    Latence, mémoire et énergie comptent autant que la capacité.

  5. 05

    Quelle évaluation ?
    Les résultats doivent correspondre aux tâches réelles.

  6. 06

    Quelles limites documentées ?
    Une architecture performante ne rend pas le système infaillible.

Sources de référence

Pour approfondir

Ces ressources présentent l’architecture originale et le mécanisme d’auto-attention.

Google ResearchArticle fondateur « Attention Is All You Need » →Google for DevelopersTransformer et auto-attention expliqués →Google ResearchPrésentation pédagogique de l’architecture →

Sources consultées le 27 septembre 2026.

La suite logique

Revenez au modèle complet pour relier attention, tokens et génération.

Comprendre les LLM

Comprendre une notion

Gardez le fil de votre apprentissage.

Une étape courte et clairement reliée à ce que vous venez de lire.