geo

SEO pour LLM : comment les modèles d’IA choisissent les marques

SEO pour LLM (LLMO) : ce que les modèles apprennent à l’entraînement, ce qu’ils cherchent sur le web au moment de répondre, et comment agir sur les deux.

Le SEO pour LLM, aussi appelé LLMO (large language model optimization), consiste à influencer les marques qu’un grand modèle de langage mentionne et la façon dont il les décrit. Un modèle connaît votre marque par deux canaux : ce qu’il a appris dans ses données d’entraînement avant sa date de coupure, et ce qu’il récupère sur le web au moment de répondre. Faire du SEO pour LLM, c’est travailler les deux, en sachant qu’ils n’évoluent pas du tout au même rythme.

La plupart des conseils GEO portent sur le second canal, celui qui produit les citations. Cet article descend d’un cran côté modèle : ce que les éditeurs d’IA documentent réellement sur les données d’entraînement, les dates de coupure, le déclenchement des recherches et les robots, et ce que chaque canal implique pour une marque.

L’essentiel à retenir

  • Le SEO pour LLM (ou LLMO) vise la façon dont le modèle lui-même mentionne et décrit votre marque, pas seulement les pages qu’il cite.
  • Un modèle connaît les marques par ses données d’entraînement, figées à une date de coupure, et par la recherche web, qui a lieu au moment de répondre.
  • Les éditeurs documentent des robots distincts pour l’entraînement et pour la recherche : bloquer un robot d’entraînement ne vous retire pas des résultats de recherche IA.
  • C’est généralement le modèle qui décide de chercher ou non. Selon la documentation des éditeurs, il cherche plutôt pour des informations récentes, changeantes ou liées à des produits précis.
  • Les connaissances issues de l’entraînement évoluent lentement, au gré des nouvelles versions de modèle. La recherche web peut refléter vos changements dès que les pages sont explorées à nouveau.
  • Une réponse sans aucune source citée vient très probablement de ce que le modèle savait déjà, ce qui vous indique sur quel canal agir.

Ce que recouvre le SEO pour LLM, et ce qui le distingue du GEO

Les termes se recoupent. Notre glossaire présente le SEO pour LLM comme une variante du GEO (generative engine optimization), et la plupart des tactiques sont communes. La différence tient à l’angle :

  • Le GEO et l’AEO partent généralement de la réponse : quelles sources sont citées, et comment en faire partie.
  • Le SEO pour LLM part du modèle : ce qu’il pense de votre catégorie, quelles marques il associe à quels besoins, et quand il prend la peine de vérifier sur le web.

Cet angle compte, car toutes les réponses ne s’appuient pas sur une recherche. Si un assistant répond de mémoire à « quel est le meilleur CRM pour une startup de 20 personnes ? », aucune page ne peut être citée.

Canal 1 : les données d’entraînement

Ce que documentent les éditeurs

Les entreprises d’IA ne décrivent leurs données d’entraînement qu’à grands traits. Le Transparency Hub d’Anthropic (en anglais) indique que les modèles Claude récents ont été entraînés sur un mélange propriétaire comprenant des informations publiquement disponibles sur internet, des jeux de données publics et privés et des données synthétiques. La vue d’ensemble des modèles d’Anthropic (en anglais) donne pour chaque modèle une « reliable knowledge cutoff », la date jusqu’à laquelle ses connaissances sont les plus étendues et les plus fiables, ainsi qu’une date de coupure distincte pour les données d’entraînement.

Les éditeurs nomment aussi les robots qui collectent le web public pour l’entraînement. La documentation d’OpenAI sur ses robots (en anglais) précise qu’interdire GPTBot signale que le contenu d’un site ne doit pas servir à entraîner les modèles de fondation. L’article d’aide d’Anthropic sur ses robots (en anglais) décrit ClaudeBot comme collectant du contenu web susceptible de contribuer à l’entraînement. La documentation de Google sur ses robots présente Google-Extended comme le réglage qui détermine si un contenu peut servir à entraîner les futurs modèles Gemini.

Ce que cela implique pour une marque

  • C’est une photo à un instant donné. Tout ce qui s’est passé après la date de coupure (nouvelle gamme, changement de prix, changement de nom) échappe aux connaissances propres du modèle.
  • Vous ne pouvez pas la retoucher. Il n’existe aucun formulaire pour corriger les données d’entraînement d’un modèle. Les changements arrivent, s’ils arrivent, avec une version future.
  • La cohérence aide probablement. Un modèle apprend des associations à partir de nombreux documents : une marque décrite de la même façon sur de nombreuses pages indépendantes a plus de chances d’être retenue ainsi. C’est une déduction, pas une règle documentée.
  • Les vieux contenus restent. Des avis ou descriptions obsolètes peuvent continuer à orienter la façon dont un modèle vous présente bien après votre changement. Notre guide pour corriger les informations erronées de l’IA sur votre marque détaille les recours possibles.

Canal 2 : la recherche web au moment de répondre

Ce que documentent les éditeurs

La recherche web au moment de répondre, ou ancrage (grounding), consiste pour l’assistant à interroger le web pendant qu’il rédige et à s’appuyer sur les résultats. La documentation des éditeurs indique qui décide de chercher, et quand :

  • Claude. La documentation de l’outil de recherche web d’Anthropic (en anglais) indique que Claude détermine quand chercher en fonction du prompt. Il cherche quand la demande dépend d’informations récentes, changeantes ou absentes de ses données d’entraînement, y compris des informations sur des organisations, des personnes ou des produits susceptibles d’avoir changé, et répond directement pour les connaissances stables.
  • Gemini. La documentation de Google sur l’ancrage avec la recherche Google (en anglais) précise que le modèle analyse le prompt, détermine si une recherche Google peut améliorer la réponse, puis génère une ou plusieurs requêtes.
  • Aperçus IA et Mode IA de Google. La documentation de Google sur les fonctionnalités d’IA indique que les deux peuvent recourir au query fan-out, c’est-à-dire à plusieurs recherches associées.
  • ChatGPT et Perplexity. Leur documentation décrit des robots dédiés à la recherche : OAI-SearchBot pour les fonctions de recherche de ChatGPT, et PerplexityBot, conçu selon la documentation de Perplexity (en anglais) pour faire apparaître et lier des sites dans ses résultats, et non pour collecter du contenu destiné aux modèles de fondation.

Il s’agit surtout de documentation pour développeurs. Les applications grand public peuvent se comporter autrement : lisez-la comme la description d’un mécanisme, pas comme une garantie.

Ce que cela implique pour une marque

Ici, ce qui compte, c’est d’être positionné sur les sous-requêtes du modèle, d’énoncer des faits clairs sur vos pages et d’être présent sur des pages tierces. Nos articles comment l’IA choisit ses sources et le query fan-out expliqué détaillent ce mécanisme.

Comment les deux canaux s’articulent

Le modèle décide s’il cherche et rédige lui-même ses requêtes. On peut raisonnablement penser que ce qu’il sait déjà d’une catégorie oriente ces requêtes et la façon dont il présente les résultats. Un modèle qui associe fortement « CRM pour startup » à deux marques peut encore les citer en premier tout en s’appuyant sur des pages qui en listent cinq.

Données d’entraînement Recherche web
Mise à jour À chaque nouvelle version du modèle À chaque recherche de l’assistant
Couverture Connaissances jusqu’à la date de coupure Pages actuelles qu’il peut trouver et lire
Exemples de robots GPTBot, ClaudeBot, Google-Extended OAI-SearchBot, Claude-SearchBot, PerplexityBot
Sources citées Non Généralement oui
Votre levier Votre présence publique sur la durée Positions, contenu des pages, couverture tierce
Délai d’effet Des mois, imprévisible Dès que les pages sont explorées à nouveau

Robots d’entraînement et robots de recherche : deux réglages distincts

Comme les éditeurs séparent leurs robots par usage, vos règles robots.txt n’agissent pas de la même façon sur les deux canaux. OpenAI précise que chaque réglage est indépendant des autres : un site peut autoriser OAI-SearchBot tout en interdisant GPTBot. Google indique que Google-Extended n’a pas d’incidence sur l’inclusion d’un site dans la recherche Google et n’est pas un signal de classement.

Bloquer les robots d’entraînement ne vous fait donc pas disparaître de la recherche IA, alors que bloquer les robots de recherche, parfois par erreur avec une règle trop large, peut retirer vos pages de la recherche web des assistants. Notre article sur les robots d’IA et le robots.txt liste les user agents, et le générateur de robots.txt pour l’IA vous aide à écrire des règles robot par robot.

Un plan de SEO pour LLM sur les deux canaux

  1. Identifiez le canal de chaque réponse. Lancez les prompts de vos acheteurs et notez quelles réponses citent des sources et lesquelles n’en citent pas. Les réponses sans source renvoient aux connaissances propres du modèle.
  2. Commencez par la recherche web. C’est le canal le plus rapide. Vérifiez l’accès des robots, énoncez des faits simples sur vos pages et visez les recherches que lancent réellement les assistants.
  3. Harmonisez la description de votre marque partout. Même catégorie, même positionnement, mêmes tarifs et mêmes noms de produits sur votre site, vos profils, les annuaires et les pages partenaires. Voir le SEO d’entité pour l’IA.
  4. Gagnez une couverture indépendante. Avis, comparatifs, médias et discussions communautaires alimentent les deux canaux : ils sont récupérés aujourd’hui et pourront faire partie des données d’entraînement de demain. Notre article backlinks ou mentions de marque explique pourquoi les mentions comptent.
  5. Mesurez à nouveau après chaque mise à jour de modèle. Une nouvelle version peut changer du jour au lendemain les réponses sans source. Relancez vos prompts quand un éditeur en publie une.

Suivre les deux canaux avec Citegram

Citegram est une extension Chrome gratuite, avec un tableau de bord, qui montre ce que dit chaque assistant et sur quoi il s’appuie :

  1. Ajoutez les prompts de vos acheteurs et les concurrents auxquels vous comparer.
  2. Lancez-les dans les vraies apps. Citegram pose chaque prompt dans ChatGPT, Gemini, Perplexity, Claude, DeepSeek, Grok et les Aperçus IA de Google, dans des onglets en arrière-plan, avec les comptes déjà connectés dans votre navigateur. Pas de clé API.
  3. Distinguez les réponses sourcées des autres. Chaque réponse est enregistrée avec les mentions, votre position et les sources et liens cités. Les réponses sans source vous orientent vers le volet entraînement.
  4. Lisez les recherches de ChatGPT. Pour ChatGPT, Citegram enregistre les recherches web lancées : vous voyez les requêtes que le modèle a rédigées lui-même.
  5. Suivez l’évolution. Part de voix par marque et par assistant, domaines les plus cités, au fil des exécutions : une mise à jour de modèle se lit comme une rupture dans la courbe.

FAQ

Qu’est-ce que le SEO pour LLM ?

Le SEO pour LLM, ou LLMO, consiste à influencer la façon dont les grands modèles de langage mentionnent et décrivent votre marque. Il couvre à la fois ce que les modèles ont appris pendant leur entraînement et ce qu’ils trouvent sur le web au moment de répondre. Il recoupe largement le GEO et l’AEO, avec davantage d’attention portée aux connaissances propres du modèle.

Comment un LLM choisit-il les marques qu’il cite ?

À partir de deux sources : les associations apprises dans ses données d’entraînement avant sa date de coupure, et les pages récupérées sur le web au moment de répondre. Selon la documentation des éditeurs, les modèles cherchent plutôt quand la question porte sur des informations récentes ou changeantes, comme des produits ou des prix. Sinon, ils répondent à partir de leur seul entraînement.

Peut-on faire entrer sa marque dans les données d’entraînement de ChatGPT ?

Pas directement : il n’existe aucune procédure de soumission. Le contenu web public peut être collecté par des robots d’entraînement comme GPTBot, mais ce qui finit dans un modèle n’est pas communiqué. La voie réaliste : une description de marque cohérente et largement publiée, et une bonne visibilité dans la recherche web en attendant.

Bloquer GPTBot nuit-il à ma visibilité dans ChatGPT ?

Selon la documentation d’OpenAI, GPTBot sert à l’entraînement et OAI-SearchBot à la recherche, et chaque réglage est indépendant. Bloquer GPTBot indique que votre contenu ne doit pas servir à l’entraînement. Cela ne bloque pas le robot de recherche de ChatGPT, tant que vous autorisez OAI-SearchBot.

Voyez ce que les modèles disent de vous

Le SEO pour LLM commence par la lecture des réponses, sourcées ou non. L’offre gratuite suit 1 prompt et 1 concurrent sur tous les principaux assistants, sans limite de durée. L’offre Pro coûte 10 $ par siège et par mois, avec prompts et concurrents illimités. Voir les tarifs.

Extension Chrome gratuite

Voyez si ChatGPT recommande votre marque

Testez une question gratuitement dans ChatGPT, Gemini, Perplexity, Claude et 3 autres assistants.

Tester ma marque gratuitement