seo

Robots.txt et crawlers IA : faut-il bloquer GPTBot et ClaudeBot ?

Quels robots IA servent à l’entraînement, lesquels à la recherche ? Autoriser ou bloquer GPTBot, OAI-SearchBot, ClaudeBot et Google-Extended.

Dans votre robots.txt, les crawlers IA se répartissent en trois familles : les robots d’entraînement (GPTBot, ClaudeBot) collectent des contenus pour entraîner les modèles, les robots de recherche (OAI-SearchBot, Claude-SearchBot, PerplexityBot) indexent les pages que les assistants peuvent citer, et les agents déclenchés par l’utilisateur (ChatGPT-User, Claude-User, Perplexity-User) consultent une page à la demande. Bloquer GPTBot exclut vos contenus de l’entraînement d’OpenAI, mais ne vous retire pas de la recherche ChatGPT. Bloquer OAI-SearchBot, si.

Beaucoup de sites bloquent « les robots IA » en bloc, puis disparaissent des réponses de l’IA sans comprendre pourquoi. Ce guide recense les user agents documentés par chaque éditeur, explique l’effet de chaque blocage et propose trois configurations robots.txt prêtes à l’emploi. Les noms et comportements proviennent de la documentation officielle de chaque éditeur, vérifiée le 9 octobre 2026.

L’essentiel à retenir

  • Chaque grand éditeur d’IA distingue robots d’entraînement, robots de recherche et agents déclenchés par l’utilisateur, chacun avec sa propre règle robots.txt.
  • Bloquer un robot d’entraînement comme GPTBot ou ClaudeBot ne vous retire pas, à lui seul, de la recherche IA de l’éditeur.
  • Bloquer un robot de recherche comme OAI-SearchBot ou PerplexityBot peut empêcher l’assistant d’afficher et de citer vos pages.
  • Les agents déclenchés par l’utilisateur ne suivent pas toujours robots.txt : selon OpenAI, les règles « peuvent ne pas s’appliquer » à ChatGPT-User, et selon Perplexity, Perplexity-User les ignore généralement.
  • Google-Extended encadre l’entraînement et l’ancrage (grounding) de Gemini, pas la recherche Google. Les Aperçus IA et le Mode IA relèvent des règles de Googlebot.

Robots d’entraînement, robots de recherche et agents utilisateur

Les robots d’entraînement collectent des pages publiques susceptibles de servir à entraîner de futurs modèles. Les bloquer revient à refuser l’entraînement, rien de plus.

Les robots de recherche construisent l’index qu’un assistant interroge quand il répond avec des résultats web. S’ils sont bloqués, l’assistant n’a plus grand-chose de vous à récupérer, et ne peut pas vous citer sur un prompt comme « meilleur CRM pour une startup de 20 personnes ».

Les agents déclenchés par l’utilisateur agissent pour le compte d’une personne, par exemple quand elle colle votre URL dans la conversation et demande un résumé. Ils n’explorent pas le web automatiquement. Comme c’est un humain qui demande la page, certains éditeurs précisent que robots.txt peut ne pas s’appliquer.

Pour comprendre le rôle de la recherche web dans les réponses, lisez comment l’IA choisit ses sources.

Le tableau de référence des crawlers IA

Jetons robots.txt tels que documentés par chaque éditeur (vérifiés le 9 octobre 2026). Les numéros de version des user agents complets évoluent : appuyez-vous sur le jeton, pas sur la chaîne entière.

Éditeur Jeton Type Rôle selon l’éditeur
OpenAI GPTBot Entraînement Explore des contenus pouvant servir à entraîner les modèles d’OpenAI
OpenAI OAI-SearchBot Recherche Fait apparaître des sites dans les fonctions de recherche de ChatGPT
OpenAI ChatGPT-User Utilisateur Certaines actions d’utilisateurs dans ChatGPT et les GPT personnalisés ; pas d’exploration automatique
OpenAI OAI-AdsBot Publicité Visite uniquement les pages soumises comme annonces sur ChatGPT, pour en vérifier la sécurité
Anthropic ClaudeBot Entraînement Collecte des contenus web pouvant contribuer à l’entraînement des modèles
Anthropic Claude-SearchBot Recherche Indexe des contenus pour améliorer la qualité des résultats de recherche de Claude
Anthropic Claude-User Utilisateur Consulte des pages quand la question d’un utilisateur de Claude le nécessite
Perplexity PerplexityBot Recherche Fait apparaître et lie des sites dans les résultats de Perplexity ; pas utilisé pour l’entraînement
Perplexity Perplexity-User Utilisateur Visite une page pour répondre à la question d’un utilisateur ; ni exploration ni entraînement
Google Google-Extended Jeton de contrôle Encadre l’usage des contenus explorés pour l’entraînement et l’ancrage de Gemini

Sources : présentation des crawlers d’OpenAI, article d’aide d’Anthropic, crawlers de Perplexity et liste des robots d’exploration courants de Google.

Google-Extended n’a pas de user agent propre : Google explore avec ses user agents habituels et lit ce jeton comme une autorisation. Il couvre l’entraînement de Gemini et l’ancrage dans les applications Gemini et Vertex AI : ce n’est donc pas un simple interrupteur d’entraînement.

Ce qui se passe quand vous bloquez chaque robot

  • GPTBot. Selon OpenAI, l’interdire indique que vos contenus ne doivent pas servir à entraîner ses modèles. OpenAI précise que chaque réglage est indépendant : vous pouvez rester dans la recherche ChatGPT tout en refusant l’entraînement.
  • OAI-SearchBot. Les sites exclus n’apparaissent pas dans les réponses de recherche de ChatGPT, même s’ils peuvent encore figurer comme liens de navigation. Comptez environ 24 heures pour qu’une modification soit prise en compte.
  • ClaudeBot. Selon Anthropic, le bloquer signale que vos futurs contenus doivent être exclus des données d’entraînement.
  • Claude-SearchBot. Le bloquer empêche l’indexation pour la recherche, ce qui peut réduire votre visibilité et l’exactitude des réponses de Claude à votre sujet.
  • Claude-User. Claude ne peut plus récupérer vos pages à la demande des utilisateurs, ce qui peut réduire votre visibilité.
  • PerplexityBot. Perplexity recommande de l’autoriser pour que votre site apparaisse dans ses résultats.
  • Google-Extended. Google indique qu’il n’a aucun effet sur l’inclusion d’un site dans la recherche Google et n’est pas un signal de classement. Il ne vous retire pas des Aperçus IA ni du Mode IA, qui reposent sur Googlebot.

Pour limiter ce que Google affiche de vos pages dans la recherche, fonctionnalités IA comprises, Google renvoie vers nosnippet, data-nosnippet, max-snippet et noindex. Ces directives touchent aussi les résultats classiques : maniez-les avec prudence.

Les configurations robots.txt recommandées

Selon le standard robots.txt, un robot suit le groupe qui le nomme le plus précisément et ignore alors le groupe User-agent: *. Si vous créez un groupe pour GPTBot, recopiez-y les Disallow généraux que vous voulez lui appliquer.

Rester visible dans la recherche IA sans servir à l’entraînement

Le choix le plus courant pour un site B2B : des pages citables, mais pas d’entraînement.

User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

Attention au compromis sur Google-Extended : comme il couvre aussi l’ancrage dans les applications Gemini, le bloquer peut limiter l’usage de vos contenus dans les réponses de Gemini.

Refus complet

User-agent: GPTBot
Disallow: /

User-agent: OAI-SearchBot
Disallow: /

User-agent: ChatGPT-User
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Claude-SearchBot
Disallow: /

User-agent: Claude-User
Disallow: /

User-agent: PerplexityBot
Disallow: /

User-agent: Perplexity-User
Disallow: /

User-agent: Google-Extended
Disallow: /

Vous sortez ainsi de la recherche IA de ces éditeurs, pas seulement de l’entraînement. Les agents utilisateur peuvent encore accéder à vos pages, selon OpenAI et Perplexity eux-mêmes, et les Aperçus IA restent liés à Googlebot.

Tout autoriser

Robots.txt autorise par défaut. Si aucun groupe ne nomme ces robots et que votre groupe User-agent: * ne les bloque pas, ils peuvent déjà explorer votre site. Des groupes Allow: / explicites servent seulement à documenter votre choix.

Vérifier votre robots.txt et vos logs serveur

  1. Lisez le fichier en ligne. Ouvrez votredomaine.com/robots.txt et cherchez chaque jeton du tableau. Vérifiez aussi chaque sous-domaine, qui a son propre fichier.
  2. Contrôlez le groupe *. Un Disallow large sous User-agent: * s’applique à tout robot IA qui n’a pas son propre groupe.
  3. Cherchez les jetons dans vos logs serveur ou CDN (GPTBot, OAI-SearchBot, ClaudeBot, Claude-SearchBot, PerplexityBot et les agents utilisateur). Regardez les codes de statut : une série de 403 signifie que le blocage vient d’ailleurs que de robots.txt.
  4. Vérifiez les adresses IP. Un user agent peut être usurpé. OpenAI, Anthropic et Perplexity publient leurs plages d’IP dans des fichiers JSON accessibles depuis leur documentation.
  5. Patientez, puis revérifiez. OpenAI et Perplexity évoquent un délai pouvant atteindre environ 24 heures.

Au-delà de robots.txt : CDN et protection anti-bots

Un robots.txt impeccable ne sert à rien si votre pare-feu bloque le robot avant. Les CDN et WAF peuvent filtrer le trafic automatisé, parfois via une option unique « bloquer les robots IA » qui ne distingue pas recherche et entraînement.

La documentation de Perplexity détaille comment autoriser ses robots dans Cloudflare et AWS WAF, par user agent et plages d’IP publiées. OpenAI recommande de même d’autoriser les requêtes venant des IP publiées d’OAI-SearchBot. Anthropic déconseille au contraire de bloquer ses robots par IP : ils ne peuvent alors plus lire votre robots.txt, et le refus risque de ne pas tenir.

Être explorable n’est qu’un préalable. Nos guides pour apparaître dans ChatGPT et être cité par Perplexity couvrent ce qui fait gagner la citation ensuite.

Vérifier avec Citegram que vous êtes toujours cité

Citegram n’analyse ni votre robots.txt ni vos logs serveur. Il montre le résultat : les assistants vous mentionnent-ils et vous citent-ils toujours après une modification ?

  1. Choisissez des prompts sur lesquels vous êtes cité aujourd’hui, comme « meilleur CRM pour une startup de 20 personnes », avant de toucher au robots.txt.
  2. Lancez-les dans les vraies apps. L’extension Chrome pose chaque prompt dans ChatGPT, Gemini, Perplexity, Claude, DeepSeek, Grok et Google AI Overviews, dans des onglets en arrière-plan, avec les comptes déjà connectés dans votre navigateur. Pas de clé API, et les questions sont décomptées de vos propres abonnements.
  3. Enregistrez le point de départ. Citegram note si votre marque est mentionnée, sa position, et les sources et liens cités dans chaque réponse.
  4. Relancez après la modification, une fois le délai de prise en compte passé, et comparez l’évolution au fil des exécutions.
  5. Regardez les domaines cités. Si vos pages disparaissent des citations alors que vos concurrents restent, revoyez d’abord vos règles pour les robots de recherche.

Les réponses proviennent de vos propres comptes : personnalisation et localisation peuvent les influencer. Pour un bilan plus complet, consultez notre guide de l’audit de visibilité IA.

FAQ

Faut-il bloquer GPTBot ?

Bloquez GPTBot si vous ne voulez pas qu’OpenAI utilise vos contenus pour l’entraînement. OpenAI le présente comme indépendant d’OAI-SearchBot : le bloquer seul ne vous retire pas de la recherche ChatGPT. Si vous voulez apparaître dans la recherche ChatGPT, laissez OAI-SearchBot autorisé.

Bloquer les crawlers IA nuit-il à mon référencement ?

Bloquer les robots des éditeurs d’IA n’a aucun effet sur Googlebot, et Google indique que Google-Extended n’est pas un signal de classement. Ce que vous risquez de perdre, c’est la visibilité dans les assistants : bloquer des robots de recherche comme OAI-SearchBot ou PerplexityBot peut exclure vos pages de leurs réponses.

Google-Extended a-t-il un effet sur la recherche Google ou les Aperçus IA ?

Selon Google, Google-Extended n’a pas d’effet sur l’inclusion dans la recherche Google et n’est pas un signal de classement. Il encadre l’usage de vos contenus pour l’entraînement et l’ancrage de Gemini. Les Aperçus IA et le Mode IA font partie de la recherche, où s’appliquent les règles de Googlebot et les directives d’extrait.

Les robots IA respectent-ils robots.txt ?

Anthropic indique que ses robots respectent les directives robots.txt, et OpenAI comme Perplexity invitent les éditeurs de sites à gérer leurs robots de recherche et d’entraînement via robots.txt. Les agents déclenchés par l’utilisateur font exception : selon OpenAI, robots.txt peut ne pas s’appliquer à ChatGPT-User, et selon Perplexity, Perplexity-User ignore généralement ces règles.

Vérifiez que vous restez visible après vos changements

Modifier un robots.txt prend quelques minutes. Vérifier que les assistants vous citent toujours, c’est ce qui compte. L’offre gratuite permet de suivre un prompt sur tous les principaux assistants, sans limite de durée. L’offre Pro ajoute les prompts illimités pour 10 $ par mois. Voir les tarifs.

Extension Chrome gratuite

Voyez si ChatGPT recommande votre marque

Testez une question gratuitement dans ChatGPT, Gemini, Perplexity, Claude et 3 autres assistants.

Tester ma marque gratuitement