Retour à l’Académie IA

Académie IA · embedding

Qu’est-ce qu’un embedding en intelligence artificielle ?

Un embedding représente un contenu sous la forme d’un vecteur de nombres qui encode certaines de ses caractéristiques. Il permet à un système de comparer la proximité entre textes, images ou autres objets et constitue une brique centrale de la recherche sémantique.

Définition 30 sec

Un embedding, ou plongement vectoriel, est une représentation numérique apprise d’un contenu dans un espace à plusieurs dimensions. Des éléments dont le sens ou les propriétés sont proches ont généralement des vecteurs proches, ce qui permet de les rechercher, les regrouper ou les comparer mathématiquement.

Comprendre

Un ordinateur ne manipule pas directement le sens d’une phrase ou d’une image. Un modèle d’embedding convertit chaque élément en une liste de nombres. La position obtenue dans l’espace vectoriel résume des caractéristiques jugées utiles par le modèle.

Deux formulations différentes, comme « délai de livraison » et « quand recevrai-je ma commande ? », peuvent ainsi être proches même si elles partagent peu de mots. Cette propriété distingue la recherche sémantique d’une recherche purement lexicale.

Un embedding n’est toutefois ni un résumé lisible ni une preuve de compréhension. Sa qualité dépend du modèle, de la langue, du domaine et de l’unité représentée. Des contenus proches dans l’espace ne sont pas nécessairement interchangeables. Les références exactes, négations, dates ou codes internes peuvent nécessiter des métadonnées et une recherche hybride.

La dimension du vecteur et la métrique de similarité ne donnent pas une qualité universelle. Deux modèles peuvent organiser différemment le même corpus ; une mise à jour du modèle peut donc nécessiter de recalculer l’index et de refaire les évaluations.

Les embeddings peuvent également refléter les biais des données d’entraînement. Une proximité mathématique n’est pas neutre : elle favorise certains rapprochements et peut en invisibiliser d’autres. Pour les usages sensibles, il faut analyser les erreurs par catégorie et ne pas se limiter à une moyenne globale.

Comment ça fonctionne ?

Un modèle d’embedding reçoit un texte, une image ou un autre contenu et calcule un vecteur de taille fixe. Ces vecteurs sont stockés avec l’objet d’origine et ses métadonnées.

Lors d’une recherche, la requête est convertie avec un modèle compatible. Une mesure de similarité compare son vecteur à ceux de l’index afin d’identifier les voisins les plus proches. Des filtres peuvent limiter les résultats selon la date, la source ou les droits d’accès.

Dans un système RAG, les contenus correspondants sont ensuite transmis au LLM. Un reranking ou une recherche lexicale complémentaire peut améliorer la sélection avant génération.

Exemple concret

Une entreprise possède des milliers de procédures rédigées avec des vocabulaires différents selon les équipes. Un collaborateur formule une question courante ; son embedding est comparé à ceux des passages documentaires. Le système retrouve une procédure pertinente même lorsque les mots exacts ne coïncident pas.

L’exemple est pédagogique. Pour être fiable, la recherche doit encore respecter les droits, privilégier les versions à jour et afficher la source afin que l’utilisateur puisse vérifier le résultat.

Pourquoi c’est important pour les entreprises ?

Les embeddings rendent interrogeables des connaissances non structurées à grande échelle. Ils soutiennent recherche sémantique, recommandation, détection de doublons, classification et RAG.

Leur apparente simplicité peut néanmoins cacher des décisions importantes : quel contenu représenter, avec quel modèle, quelle granularité, quelles métadonnées et quelles règles de mise à jour ? Un index performant sur un test générique peut échouer sur le vocabulaire réel de l’entreprise.

La valeur vient donc d’un système d’accès à l’information évalué sur des requêtes métier, relié à une gouvernance documentaire et combiné à d’autres méthodes lorsque la précision exacte est indispensable.

L’évaluation doit partir de questions et de jugements réels. On mesure si les bons documents apparaissent parmi les premiers résultats, si les références exactes sont retrouvées et si les filtres de droits fonctionnent. L’évaluation de la réponse finale ne suffit pas pour diagnostiquer une mauvaise recherche.

Le cycle de vie mérite aussi d’être prévu : ajout, suppression, réindexation et droit à l’effacement. Un vecteur reste une représentation dérivée d’une donnée et doit être gouverné avec la source dont il provient.