Votre robots.txt bloque ChatGPT sans que vous le sachiez

Cyril Cretin
Fondateur RadarLLM.ai
Votre site est peut-être invisible pour ChatGPT, Claude, Perplexity ET Gemini en ce moment. La cause la plus fréquente : votre robots.txt. De nombreux hébergeurs, CDN et plugins de sécurité bloquent les crawlers IA par défaut, sans vous prévenir. Résultat : les IA ne peuvent tout simplement pas lire votre site.
5,89% de tous les sites web bloquent GPTBot. Et parmi les grands éditeurs, 79% bloquent au moins un bot IA. Si vous n'avez jamais vérifié votre robots.txt, il y a de fortes chances que vous fassiez partie de ces statistiques.
Les bots IA que vous devez connaître
Chaque plateforme IA utilise un ou plusieurs bots pour crawler le web. Voici la liste complète des bots que votre robots.txt doit autoriser :
| Bot | Plateforme | Fonction | Autoriser ? |
|---|---|---|---|
| GPTBot | ChatGPT | Entraînement + recherche | Oui |
| OAI-SearchBot | ChatGPT Search | Recherche temps réel | Oui |
| ChatGPT-User | ChatGPT | Navigation utilisateur | Oui |
| ClaudeBot | Claude | Entraînement + citations | Oui |
| anthropic-ai | Anthropic | Entraînement | Oui |
| PerplexityBot | Perplexity | Recherche + citations | Oui |
| Google-Extended | Gemini | Entraînement + AI Overviews | Oui |
| Googlebot | Recherche classique | Oui |
Comment vérifier si votre robots.txt bloque les IA
Ouvrez votre navigateur et allez sur votre-site.com/robots.txt
Cherchez chaque nom de bot listé ci-dessus (GPTBot, ClaudeBot, PerplexityBot, Google-Extended...)
Recherchez les règles "Disallow: /" associées à ces bots — c'est le signal de blocage
Voici les patterns les plus courants qui bloquent les crawlers IA :
# Exemples de règles qui BLOQUENT les IA :
User-agent: GPTBot
Disallow: / # ← Bloque ChatGPT
User-agent: ClaudeBot
Disallow: / # ← Bloque Claude
User-agent: *
Disallow: / # ← Bloque TOUT, y compris les IA
User-agent: CCBot
Disallow: / # ← Bloque les crawlers Common Crawl
# (utilisés par beaucoup de LLMs)Le robots.txt idéal pour la visibilité IA
Voici un robots.txt complet qui autorise explicitement tous les crawlers IA importants. Copiez-le et adaptez les URLs à votre domaine :
# robots.txt — optimisé pour la visibilité IA # Généré par RadarLLM.ai # Google (recherche classique) User-agent: Googlebot Allow: / # Google (IA / Gemini / AI Overviews) User-agent: Google-Extended Allow: / # OpenAI (ChatGPT) User-agent: GPTBot Allow: / # OpenAI (ChatGPT Search) User-agent: OAI-SearchBot Allow: / # OpenAI (navigation utilisateur ChatGPT) User-agent: ChatGPT-User Allow: / # Anthropic (Claude) User-agent: ClaudeBot Allow: / User-agent: anthropic-ai Allow: / # Perplexity User-agent: PerplexityBot Allow: / # Bing User-agent: Bingbot Allow: / # DuckDuckGo AI User-agent: DuckAssistBot Allow: / # Cohere User-agent: cohere-ai Allow: / # Tous les autres bots User-agent: * Allow: / Disallow: /admin/ Disallow: /api/ Disallow: /private/ # Sitemap Sitemap: https://votre-site.com/sitemap.xml
Conseil : RadarLLM génère automatiquement un robots.txt optimisé pour votre site lors de chaque audit. Le fichier est inclus dans le ZIP de correctifs.
Les pièges courants
Même si votre robots.txt semble correct, d'autres couches peuvent bloquer les crawlers IA :
Plugins de sécurité WordPress
Wordfence, Sucuri et iThemes Security ajoutent souvent des règles bloquant les bots IA dans votre robots.txt sans vous prévenir. Vérifiez la section "Blocage de bots" de votre plugin après chaque mise à jour.
Cloudflare "Bot Fight Mode"
Le mode Bot Fight de Cloudflare bloque les crawlers IA légitimes en les identifiant comme des menaces. Désactivez-le ou ajoutez des exceptions pour GPTBot, ClaudeBot et PerplexityBot dans vos règles WAF.
Blocage IP au niveau CDN
Certains CDN et hébergeurs bloquent les plages IP utilisées par les crawlers IA. Ce blocage est invisible dans votre robots.txt. Vérifiez vos logs serveur pour détecter des requêtes bloquées (403).
Règles wildcard trop larges
Une règle "User-agent: * / Disallow: /admin/" semble inoffensive, mais certains hébergeurs ajoutent "Disallow: /" pour tous les agents non reconnus. Vérifiez que votre wildcard n'est pas trop restrictif.
Que faire après avoir corrigé votre robots.txt
Corriger le robots.txt est la première étape. Voici ce qui vient ensuite :
Attendez 4 à 8 semaines
Les crawlers IA ne repassent pas immédiatement. Après correction, comptez 4 à 8 semaines pour que GPTBot, ClaudeBot et PerplexityBot re-indexent votre site.
Surveillez avec RadarLLM
Lancez un audit de visibilité IA pour voir quels LLMs vous citent déjà. Refaites un audit après 8 semaines pour mesurer la progression.
Ajoutez des données structurées
Le robots.txt ouvre la porte. Les schemas JSON-LD (FAQPage, Organization) aident les IA à comprendre et citer votre contenu. Implémentez-les en priorité.
Créez un fichier llms.txt
Le robots.txt dit aux IA ce qu'elles peuvent explorer. Le llms.txt leur dit qui vous êtes. Les deux fichiers sont complémentaires et essentiels en 2026.
Articles liés
Votre robots.txt bloque-t-il les IA ?
Scanner mon site gratuitementScan gratuit en moins d’une minute · Fichiers correctifs avec l’audit complet