Gratuit · Sans inscription · Dans votre navigateur

Générateur et vérificateur de robots.txt pour l’IA

Choisissez les robots IA autorisés à lire votre site, de GPTBot à PerplexityBot, et obtenez un bloc robots.txt prêt à coller. Ou vérifiez un fichier existant pour voir quels robots IA il autorise ou bloque, et quelle règle en décide.

Partir d’un préréglage
  • GPTBotEntraînement

    Contenus pouvant servir à entraîner les modèles de fondation d’OpenAI

    GPTBot
  • OAI-SearchBotRecherche IA

    Fait apparaître les sites dans la recherche de ChatGPT

    OAI-SearchBot
  • ChatGPT-UserDéclenché par l’utilisateur

    Certaines actions des utilisateurs de ChatGPT et des GPT personnalisés, pas d’exploration automatique

    ChatGPT-User
  • OAI-AdsBotContrôle des annonces

    Visite uniquement les pages soumises comme annonces sur ChatGPT, pour vérifier leur sécurité

    OAI-AdsBot
  • ClaudeBotEntraînement

    Contenus web pouvant contribuer à l’entraînement des modèles

    ClaudeBot
  • Claude-SearchBotRecherche IA

    Indexe les contenus pour améliorer les résultats de recherche de Claude

    Claude-SearchBot
  • Claude-UserDéclenché par l’utilisateur

    Récupère des pages quand un utilisateur de Claude pose une question qui les nécessite

    Claude-User
  • PerplexityBotRecherche IA

    Fait apparaître et lie les sites dans les résultats de Perplexity, sans entraînement

    PerplexityBot
  • Perplexity-UserDéclenché par l’utilisateur

    Visite une page pour répondre à la question d’un utilisateur, sans exploration ni entraînement

    Perplexity-User
  • Google-ExtendedEntraînement et ancrage Gemini

    Encadre l’usage de vos contenus pour l’entraînement et l’ancrage de Gemini, pas la recherche Google

    Google-Extended

Collez-le pour conserver vos autres règles. La section IA est ajoutée à la fin, ou remplacée si elle a été générée ici.

robots.txt

# AI crawlers (generated by citegram.com/tools/ai-robots-txt-generator)

# OpenAI
User-agent: GPTBot
Disallow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: OAI-AdsBot
Allow: /

# Anthropic
User-agent: ClaudeBot
Disallow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: Claude-User
Allow: /

# Perplexity
User-agent: PerplexityBot
Allow: /

User-agent: Perplexity-User
Allow: /

# Google
User-agent: Google-Extended
Disallow: /
# End of AI crawlers
  • Bloquer Google-Extended vous retire de l’entraînement et de l’ancrage de Gemini. Selon Google, la recherche Google n’est pas concernée, et les Aperçus IA suivent les règles de Googlebot.

robots.txt décide seulement qui peut lire votre site. Citegram montre si les assistants vous citent vraiment.

Suivez-le dans ChatGPT, Gemini, Perplexity… avec Citegram (gratuit)

Comment utiliser le générateur robots.txt IA

Pour générer des règles : partez d’un préréglage. Recherche IA autorisée, entraînement bloqué convient à la plupart des sites B2B qui veulent être cités par les assistants sans alimenter l’entraînement des modèles. Basculez ensuite chaque robot entre Autoriser et Bloquer. Si vous collez votre robots.txt actuel dans le champ facultatif, vos autres règles sont conservées et la section IA est ajoutée à la fin (ou remplacée, si vous l’aviez déjà générée ici). Ajoutez l’URL de votre sitemap si vous souhaitez qu’elle figure dans le fichier. Copiez le résultat ou téléchargez-le sous le nom robots.txt, puis déposez-le à la racine de votre domaine.

Pour vérifier un fichier : ouvrez l’onglet Vérifier et collez le contenu de votredomaine.com/robots.txt. Pour chaque robot IA documenté, l’outil indique s’il peut lire votre page d’accueil (/), la ligne exacte qui en décide, et un résumé en langage clair. Un exemple réaliste est déjà chargé pour vous montrer le résultat.

Tout fonctionne dans votre navigateur. Rien de ce que vous collez n’est envoyé.

Robots d’entraînement, robots de recherche et agents utilisateur

Chaque éditeur distingue ses robots selon leur rôle, et chacun lit son propre groupe dans robots.txt. Les robots d’entraînement (GPTBot, ClaudeBot) collectent des pages susceptibles de servir à entraîner des modèles. Les robots de recherche (OAI-SearchBot, Claude-SearchBot, PerplexityBot) construisent l’index que les assistants interrogent avant de citer une source. Les agents déclenchés par l’utilisateur (ChatGPT-User, Claude-User, Perplexity-User) ouvrent une page quand quelqu’un la demande.

C’est pourquoi bloquer GPTBot exclut vos contenus de l’entraînement d’OpenAI sans vous retirer de la recherche ChatGPT, alors que bloquer OAI-SearchBot peut le faire. Google-Extended est un jeton de contrôle, pas un robot : selon Google, il encadre l’usage de vos contenus pour l’entraînement et l’ancrage de Gemini et n’a pas d’effet sur la recherche Google. Les Aperçus IA suivent les règles de Googlebot. La référence complète, avec la documentation de chaque éditeur, se trouve dans notre guide robots.txt et crawlers IA.

Comment le vérificateur lit votre robots.txt

Le vérificateur suit la norme robots.txt (RFC 9309). Un robot utilise le groupe dont le User-agent nomme son jeton, sans tenir compte de la casse. Si plusieurs groupes le nomment, leurs règles sont combinées. C’est seulement quand aucun groupe ne le nomme qu’il se rabat sur User-agent: *. Parmi les règles qui correspondent à un chemin, la plus longue l’emporte, et Allow l’emporte en cas d’égalité. Un Disallow: vide ne bloque rien.

Autorisé, N chemins restreints signifie que le robot peut lire votre page d’accueil, mais que des règles Disallow de son groupe visent d’autres chemins. C’est souvent voulu (administration, panier, pages de recherche). L’erreur la plus fréquente qu’il révèle est inverse : un site ajoute un groupe dédié à un robot IA et oublie que ce robot ignore désormais toutes les règles du groupe *. Le générateur s’en charge pour vous en reprenant vos règles * dans chaque groupe IA autorisé.

Bonnes pratiques pour les robots IA dans robots.txt

Décidez par rôle, pas par éditeur. Si la visibilité dans l’IA compte pour vous, gardez les robots de recherche autorisés, même si vous refusez l’entraînement. Méfiez-vous des réglages « bloquer tous les robots IA » d’un CDN ou d’un pare-feu : ils ne distinguent souvent pas recherche et entraînement, et une requête bloquée n’atteint jamais votre robots.txt. Anthropic déconseille aussi de bloquer ses robots par adresse IP, car ils ne peuvent alors plus lire votre refus.

Chaque sous-domaine a besoin de son propre robots.txt. Les éditeurs évoquent un délai pouvant aller jusqu’à environ 24 heures avant la prise en compte. Robots.txt est une demande, pas un contrôle d’accès : selon OpenAI, ses règles peuvent ne pas s’appliquer à ChatGPT-User, et selon Perplexity, Perplexity-User les ignore généralement. Les user agents peuvent aussi être usurpés : comparez vos logs serveur aux plages d’adresses IP publiées par les éditeurs.

Ce que robots.txt ne vous dira pas

Un robots.txt propre signifie seulement que les robots IA ont le droit de lire vos pages. Il ne vous dit pas si ChatGPT, Perplexity ou Gemini mentionnent réellement votre marque ou citent votre site quand vos clients posent des questions sur votre secteur.

Citegram est une extension Chrome gratuite qui mesure ce résultat. Elle pose vos prompts dans ChatGPT, Gemini, Perplexity, Claude, DeepSeek, Grok et les Aperçus IA de Google, avec les comptes déjà connectés dans votre navigateur, puis enregistre si votre marque est citée, sa position et les sources de chaque réponse. Lancez vos prompts avant de modifier robots.txt, puis après le délai de prise en compte des éditeurs, pour confirmer que vous êtes toujours cité. Le plan gratuit suit un prompt, et Pro ajoute des prompts illimités pour 10 $ par mois.

FAQ

Comment bloquer GPTBot dans robots.txt ?

Ajoutez un groupe User-agent: GPTBot suivi de Disallow: /. OpenAI présente GPTBot comme indépendant d’OAI-SearchBot : vous refusez ainsi l’entraînement sans quitter la recherche ChatGPT. Gardez OAI-SearchBot autorisé si vous voulez y rester visible.

Bloquer les robots IA nuit-il à mon référencement Google ?

Bloquer GPTBot, ClaudeBot ou PerplexityBot n’a aucun effet sur Googlebot. Google indique aussi que Google-Extended n’influe ni sur l’inclusion dans la recherche Google ni sur le classement. Ce que vous pouvez perdre, c’est la visibilité dans les assistants IA, si vous bloquez leurs robots de recherche.

Quels robots IA faut-il autoriser ?

Pour être cité par les assistants IA, autorisez les robots de recherche : OAI-SearchBot, Claude-SearchBot et PerplexityBot. Autoriser ou non les robots d’entraînement comme GPTBot et ClaudeBot est un choix distinct, qui concerne l’entraînement des modèles. Le préréglage « Recherche IA autorisée, entraînement bloqué » applique cette séparation.

Les robots IA respectent-ils vraiment robots.txt ?

Anthropic affirme que ses robots respectent robots.txt, et OpenAI comme Perplexity invitent les éditeurs de sites à gérer leurs robots de recherche et d’entraînement par ce biais. Les agents déclenchés par l’utilisateur font exception : selon OpenAI, robots.txt peut ne pas s’appliquer à ChatGPT-User, et selon Perplexity, Perplexity-User l’ignore généralement. Les sources sont dans notre guide complet.

Pourquoi un robot reste-t-il autorisé alors que mon groupe User-agent: * bloque tout ?

Cela n’arrive que si un groupe nomme ce robot. Un robot qui a son propre groupe suit uniquement ce groupe et ignore complètement User-agent: *. Le vérificateur indique le groupe et la ligne appliqués, pour repérer un Allow: / ou un Disallow: vide qui annule vos règles générales.

Pour aller plus loinLire le guide complet