Guide · Crawl IA
robots.txt & robots IA : ouvrir la porte aux moteurs IA
Si votre site bloque les robots d'IA, vous êtes invisible dans leurs réponses. Voici comment vérifier et corriger l'accès de GPTBot, ClaudeBot, PerplexityBot & co.
C'est quoi, robots.txt ?
C'est un fichier texte placé à la racine de votre site (votre-site.com/robots.txt) qui indique aux robots quelles parties ils ont le droit de visiter. Chaque robot s'identifie par un nom : son « user-agent ». Pour chaque user-agent, on peut autoriser (Allow) ou interdire (Disallow) des chemins. Le format suit le Robots Exclusion Protocol, un standard respecté par tous les grands acteurs.
Concrètement, un robot qui arrive sur votre site lit d'abord ce fichier, repère le bloc qui correspond à son nom, et applique les règles qu'il y trouve. S'il ne trouve pas de bloc à son nom, il applique les règles du bloc générique User-agent: *. C'est pourquoi un Disallow: / placé sous * bloque potentiellement tous les robots, IA comprises.
Pourquoi c'est critique pour l'IA
Les IA ont leurs propres robots : GPTBot (ChatGPT), OAI-SearchBot (recherche OpenAI), ClaudeBot (Claude / Anthropic), PerplexityBot (Perplexity) et Google-Extended (les IA de Google). Si votre robots.txt les bloque — parfois sans le savoir — ces IA ne peuvent pas lire votre site, donc ne vous citeront jamais. C'est le point le plus binaire de tout le référencement IA : c'est une porte, ouverte ou fermée.
Le piège classique : un blocage hérité. Beaucoup de sites ont copié, il y a quelques années, des règles toutes faites qui bloquaient GPTBot par peur de « se faire aspirer ». Aujourd'hui, ces mêmes règles les rendent invisibles dans ChatGPT. D'autres traînent un Disallow: / oublié depuis une phase de pré-production. Dans les deux cas, le contenu est parfait, mais personne ne peut le lire.
Comment les autoriser
Vérifiez votre robots.txt et assurez-vous que les robots IA ne sont pas bloqués. Pour les autoriser explicitement :
# Autoriser les robots d'IA
User-agent: GPTBot
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Google-Extended
Allow: /Procédez ainsi :
- Ouvrez
votre-site.com/robots.txtdans un navigateur pour voir son contenu réel. - Repérez tout
Disallow: /sousUser-agent: *ou sous un robot IA : c'est la cause la plus fréquente d'invisibilité. - Ajoutez un bloc par robot IA que vous voulez accueillir, avec
Allow: /(voir l'exemple ci-dessus). - Conservez votre
Sitemap:en bas du fichier pour aider tous les robots à trouver vos pages. - Re-vérifiez après mise en ligne : le robots.txt de production peut différer de celui de votre environnement de test.
Attention à l'inverse : une règle Disallow: / sous l'un de ces user-agents les bloque totalement. Et n'oubliez pas que robots.txt fonctionne par coopération : il indique une préférence que les robots sérieux respectent, mais ne constitue pas une sécurité technique. Pour réellement empêcher l'accès à une zone sensible, utilisez une authentification ou un blocage côté serveur.
Les principaux robots IA à connaître
Chaque acteur a parfois plusieurs robots, aux rôles distincts. Voici les plus importants à reconnaître dans vos journaux ou votre robots.txt :
- GPTBot — collecte de contenu par OpenAI (entraînement et amélioration des modèles).
- OAI-SearchBot — indexation pour la recherche d'OpenAI, distincte de GPTBot.
- ChatGPT-User — déclenché en direct quand un utilisateur de ChatGPT demande à consulter une page.
- ClaudeBot — robot d'Anthropic (Claude).
- PerplexityBot — robot d'indexation de Perplexity.
- Google-Extended — non un crawler, mais un contrôle d'usage : il dit si Google peut utiliser votre contenu pour ses IA (Gemini, AI Overviews), sans affecter l'indexation classique.
- Applebot-Extended — équivalent côté Apple pour l'usage de votre contenu par ses modèles.
Distinction importante : un robot d'entraînement (comme GPTBot) collecte du contenu pour améliorer un modèle, tandis qu'un robot « user » (comme ChatGPT-User) va chercher une page à la volée pour répondre à une demande précise. Bloquer le premier mais autoriser le second est un choix légitime : vous limitez l'usage de votre contenu pour l'entraînement tout en restant consultable lors d'une requête réelle.
Comment vérifier ce que voient les robots
- Ouvrez votre robots.txt directement dans le navigateur et lisez chaque bloc
User-agent. - Consultez vos journaux serveur (logs) : ils montrent quels robots IA passent réellement et sur quelles pages.
- Vérifiez aussi les balises
meta robotset l'en-tête HTTPX-Robots-Tag: unnoindexpeut bloquer l'indexation même si le robots.txt autorise l'accès. - Contrôlez les protections périphériques (pare-feu applicatif, CDN, anti-bot) : certaines bloquent les robots IA en amont, avant même le robots.txt.
Cette dernière vérification est souvent oubliée : un service de protection ou un CDN mal configuré peut rejeter GPTBot ou ClaudeBot au niveau réseau, indépendamment de ce que dit votre robots.txt. Si vos robots IA sont autorisés dans le fichier mais n'apparaissent jamais dans les logs, c'est la piste à creuser.
Les erreurs courantes à éviter
- Bloquer Googlebot avec Google-Extended. Ce sont deux user-agents différents : bloquer l'IA ne doit pas bloquer la recherche, et inversement.
- Mal orthographier un user-agent.
GptBotouGpt-Botne correspondent à rien : le nom exact estGPTBot. - Croire que robots.txt cache une page. Une URL bloquée peut tout de même apparaître si elle est liée ailleurs ; pour empêcher l'indexation, utilisez plutôt une balise
noindex. - Oublier de tester. Une simple faute de frappe dans le fichier peut neutraliser toutes les règles qui suivent.
En résumé, votre robots.txt est le tout premier filtre que rencontre une IA. Tant qu'il n'autorise pas explicitement les robots IA, aucun travail de contenu ou de balisage ne pourra produire de citation. C'est la première chose à vérifier dans un audit GEO.
Questions fréquentes
Quels robots IA dois-je autoriser ?
Autorisez au minimum GPTBot (ChatGPT), OAI-SearchBot (recherche OpenAI), ClaudeBot (Anthropic), PerplexityBot (Perplexity) et Google-Extended (qui contrôle l'usage de votre contenu par les IA de Google comme les AI Overviews et Gemini). Google-Extended ne bloque pas l'indexation classique par Googlebot, il ne concerne que l'usage IA. Ajoutez Applebot-Extended si vous visez l'écosystème Apple. Règle générale : pour être cité par une IA, son robot doit pouvoir lire vos pages.
Comment bloquer un robot IA précis ?
Ajoutez un bloc dédié avec le nom exact du user-agent, suivi de Disallow: / pour tout interdire. Exemple : User-agent: GPTBot puis Disallow: / empêche le robot de ChatGPT de lire votre site tout en laissant les autres robots libres. Vous pouvez aussi limiter à un répertoire avec Disallow: /prive/. Attention : robots.txt repose sur la coopération du robot ; les grands acteurs le respectent, mais ce n'est pas une barrière technique. Pour une protection stricte, bloquez côté serveur.
Bloquer les robots IA nuit-il à mon SEO Google ?
Non, à condition de bien viser. Bloquer Google-Extended ou GPTBot n'a aucun effet sur votre référencement classique : Googlebot, le robot qui indexe pour la recherche Google, est un user-agent distinct. Attention en revanche à ne pas bloquer Googlebot par erreur, ni à utiliser un Disallow: / global qui s'appliquerait à tous les robots. L'erreur la plus coûteuse est un blocage hérité d'un environnement de test : vérifiez toujours votre robots.txt en production.
Vos robots IA sont-ils autorisés ?
Vérifier gratuitement mon site