Collecter
Créer, mesurer, acheter ou réutiliser des informations provenant de sources identifiées.
La matière première des modèles
Une donnée est une information enregistrée sous une forme qu’un système peut traiter : nombre, mot, image, son, clic ou mesure. Seule, elle ne « dit » pas tout. Son origine, sa qualité et la façon dont elle est préparée changent ce que l’IA pourra apprendre.
Observer avant d’apprendre
Choisissez un type de donnée. L’IA ne reçoit pas notre expérience du monde : elle traite une représentation numérique préparée pour une tâche.
Du monde réel au modèle
Créer, mesurer, acheter ou réutiliser des informations provenant de sources identifiées.
Retirer les doublons, corriger des erreurs et limiter les éléments inutiles.
Ajouter parfois une étiquette humaine : « spam », « chat », « avis positif ».
Convertir les informations en représentations numériques adaptées au modèle.
Séparer entraînement, validation et test, puis documenter la provenance et les limites.
Un exemple et une étiquette
Dans l’apprentissage supervisé, des personnes peuvent associer une réponse attendue à chaque exemple. Cette annotation sert de repère au modèle.
Pour détecter les courriels indésirables, on peut fournir le contenu d’un message avec l’étiquette « spam » ou « non-spam ». Si les consignes sont floues ou les annotations incohérentes, le modèle reçoit de mauvais repères.
« Vous avez gagné. Cliquez immédiatement pour recevoir votre lot. »
La qualité avant la quantité
Un million d’exemples presque identiques ne représente pas forcément le monde réel. Une base utile doit correspondre à la tâche, couvrir les situations importantes et contenir le moins possible d’erreurs évitables.
Les valeurs et les étiquettes sont-elles suffisamment fiables ?
Les cas, langues et publics nécessaires sont-ils présents ?
Les informations correspondent-elles encore à la réalité ?
Chaque donnée aide-t-elle réellement à accomplir la tâche prévue ?
Public ne signifie pas libre de tout usage
Une information visible sur Internet peut rester protégée par le droit d’auteur, le droit des données personnelles ou les conditions du site qui la publie.
Elle permet d’identifier directement ou indirectement une personne : nom, image, voix, identifiant, localisation…
Elle révèle notamment la santé, les opinions politiques, la religion, la biométrie ou l’orientation sexuelle. Sa protection est renforcée.
Elle ne doit plus permettre raisonnablement d’identifier une personne. Remplacer un nom par un numéro ne suffit pas toujours.
Votre conversation aussi contient des données
Trois idées à corriger
Non. L’accès public ne supprime pas automatiquement les droits, la vie privée ni les conditions de réutilisation.
Non. La quantité ne compense pas toujours des erreurs, un manque de diversité ou un mauvais lien avec la tâche.
Non. Le choix de ce que l’on collecte, exclut, corrige et étiquette reflète des décisions humaines.
Sources pédagogiques et institutionnelles
Ces références détaillent la constitution, la qualité et la protection des jeux de données utilisés en apprentissage automatique.
Sources consultées le 27 septembre 2026.
La suite logique
Comprendre une notion
Une étape courte et clairement reliée à ce que vous venez de lire.