Du texte vers les pixels

Comment une IA crée-t-elle une image ?

Elle ne dessine pas comme une personne et ne cherche pas simplement une photo toute faite. Beaucoup de générateurs partent d’un bruit aléatoire puis le transforment progressivement, guidés par votre texte et par ce que le modèle a appris.

À retenirLe prompt oriente le calcul ; il ne décrit jamais parfaitement tous les pixels.
Bruit → formes → détails

Démonstration

Construisez le prompt morceau par morceau

Choisissez un élément. Le panneau montre ce qu’il apporte, ce qu’il ne garantit pas et la demande complète obtenue.

Une explication simplifiée

Exemple : « un chat sur un vélo rouge »

Le générateur commence par une image bruitée, puis la transforme progressivement en tenant compte des mots « chat », « vélo » et « rouge ». Une autre graine aléatoire donnera une composition différente avec la même consigne : il ne retrouve pas une image unique cachée dans sa mémoire.

Du bruit à l’image, par petites corrections

Les modèles n’utilisent pas tous exactement la même technique. Pour les modèles de diffusion, très répandus, le mécanisme général peut se résumer en quatre étapes.

1

Partir du bruit

Le système commence avec une configuration aléatoire, comparable à une télévision brouillée.

2

Lire le guide

Un encodeur transforme les mots du prompt en représentations numériques qui orientent les corrections.

3

Retirer du bruit

À chaque étape, le modèle estime une version un peu plus cohérente avec la demande.

4

Décoder l’image

Une représentation interne est finalement convertie en pixels visibles.

Cette métaphore aide à comprendre le principe, mais elle simplifie les calculs réels. Certains modèles récents utilisent des variantes comme les transformeurs de diffusion ou les flux rectifiés.

Ce que le système fait vraiment

Ce n’est ni une banque d’images, ni un collage automatique

Pendant l’entraînement, le modèle ajuste de très nombreux paramètres pour apprendre des relations statistiques entre des descriptions et des caractéristiques visuelles.

Lorsqu’il génère, il calcule une nouvelle sortie à partir de ces paramètres, du prompt et d’un point de départ aléatoire. Il ne récupère pas normalement une image précise dans une galerie pour la recoller.

Mais « nouvelle » ne veut pas dire « sans histoire ». Les données d’entraînement, une éventuelle mémorisation et la proximité avec des œuvres existantes restent des sujets importants. L’origine du modèle et ses conditions d’utilisation comptent.

RechercheRetrouver

Une image déjà publiée et son adresse.

GénérationCalculer

Une sortie à partir du modèle et de la demande.

Pourquoi le résultat change

Le même prompt peut donner plusieurs images

Le point de départ aléatoire, souvent contrôlé par une « graine » ou seed, influence le résultat. Le modèle, le nombre d’étapes, les dimensions et le niveau de guidage comptent aussi.

Deux générations peuvent donc respecter la même idée tout en changeant la pose, la lumière ou l’arrière-plan. Conserver la même graine aide parfois à comparer une petite modification, sans garantir une identité parfaite entre outils ou versions.

Graine 18

Sujet centré, horizon bas

Graine 42

Sujet décalé, horizon haut

Quatre opérations à distinguer

Créer, modifier, varier ou agrandir

Texte → image

Générer

Créer une composition à partir d’une description.

Image + consigne

Modifier

Remplacer une zone, ajouter un élément ou changer l’ambiance.

Image → variantes

Explorer

Produire plusieurs interprétations proches d’un visuel.

Petite → grande

Agrandir

Ajouter des détails plausibles pour augmenter la définition, sans retrouver magiquement des détails réels absents.

Une méthode facile à retenir

Un bon prompt d’image en cinq blocs

Commencez simple, générez, observez puis modifiez un élément à la fois. Une longue liste d’adjectifs n’est pas forcément plus efficace.

  1. Sujet et actionQui ou quoi ? Que se passe-t-il ?
  2. Lieu et époqueDans quel décor et à quel moment ?
  3. CadragePlan large, vue de dessus, portrait rapproché…
  4. Lumière et ambianceDouce, nocturne, joyeuse, brumeuse…
  5. Contraintes utilesFormat, fond, espace libre, absence de texte…

Les limites à connaître

Une belle image peut rester fausse ou problématique

Exactitude

Détails incohérents

Nombre d’objets, texte intégré, anatomie, ombres ou perspective peuvent être erronés.

Représentation

Stéréotypes

Les associations apprises peuvent reproduire des visions déséquilibrées des métiers, cultures, âges ou genres.

Personnes réelles

Confusion et atteinte

Une fausse scène crédible peut tromper, nuire à la réputation ou utiliser l’image d’une personne sans accord.

Droits

Usage à vérifier

Les règles du service, la licence, les marques et la ressemblance avec une œuvre doivent être examinées avant publication.

Avant de publier

Cinq réflexes responsables

  1. 01

    Ne créez pas une fausse scène impliquant une personne réelle sans son accord.

  2. 02

    Inspectez les détails, le texte, les symboles et les stéréotypes visibles.

  3. 03

    Vérifiez les conditions d’utilisation et les droits nécessaires à votre projet.

  4. 04

    Indiquez qu’un visuel est synthétique lorsque le contexte pourrait créer une confusion.

  5. 05

    Conservez le prompt, l’outil et la date si vous devez expliquer comment l’image a été produite.

Trois idées à corriger

Générer n’est pas appuyer sur un bouton magique

« L’IA imagine comme nous. »

Elle calcule des relations apprises. Elle n’a ni intention artistique, ni expérience de la scène.

« Elle copie toujours une photo existante. »

Ce n’est pas son fonctionnement normal, mais des ressemblances et une mémorisation partielle peuvent exister.

« Si l’image paraît réelle, elle est fiable. »

Le réalisme visuel ne prouve ni l’événement, ni le lieu, ni l’identité d’une personne.

Sources techniques et institutionnelles

Pour aller à la source

Ces références décrivent le fonctionnement des modèles de diffusion et les précautions liées aux images synthétiques.

Hugging FaceComposants d’un modèle de diffusion et débruitage →Article scientifique DDPMLes modèles probabilistes de diffusion →CNILHypertrucages, risques et bons réflexes →

Sources consultées le 27 septembre 2026.

La suite logique

Apprenez à distinguer un visuel crédible d’une preuve vérifiée.

Reconnaître un contenu suspect

Comprendre une notion

Gardez le fil de votre apprentissage.

Une étape courte et clairement reliée à ce que vous venez de lire.