RadarLLM
2026-04-087 minTechnique

Votre robots.txt bloque ChatGPT sans que vous le sachiez

Cyril Cretin

Cyril Cretin

Fondateur RadarLLM.ai

Votre site est peut-être invisible pour ChatGPT, Claude, Perplexity ET Gemini en ce moment. La cause la plus fréquente : votre robots.txt. De nombreux hébergeurs, CDN et plugins de sécurité bloquent les crawlers IA par défaut, sans vous prévenir. Résultat : les IA ne peuvent tout simplement pas lire votre site.

5,89% de tous les sites web bloquent GPTBot. Et parmi les grands éditeurs, 79% bloquent au moins un bot IA. Si vous n'avez jamais vérifié votre robots.txt, il y a de fortes chances que vous fassiez partie de ces statistiques.

Les bots IA que vous devez connaître

Chaque plateforme IA utilise un ou plusieurs bots pour crawler le web. Voici la liste complète des bots que votre robots.txt doit autoriser :

BotPlateformeFonctionAutoriser ?
GPTBotChatGPTEntraînement + rechercheOui
OAI-SearchBotChatGPT SearchRecherche temps réelOui
ChatGPT-UserChatGPTNavigation utilisateurOui
ClaudeBotClaudeEntraînement + citationsOui
anthropic-aiAnthropicEntraînementOui
PerplexityBotPerplexityRecherche + citationsOui
Google-ExtendedGeminiEntraînement + AI OverviewsOui
GooglebotGoogleRecherche classiqueOui

Comment vérifier si votre robots.txt bloque les IA

1.

Ouvrez votre navigateur et allez sur votre-site.com/robots.txt

2.

Cherchez chaque nom de bot listé ci-dessus (GPTBot, ClaudeBot, PerplexityBot, Google-Extended...)

3.

Recherchez les règles "Disallow: /" associées à ces bots — c'est le signal de blocage

Voici les patterns les plus courants qui bloquent les crawlers IA :

# Exemples de règles qui BLOQUENT les IA :

User-agent: GPTBot
Disallow: /          # ← Bloque ChatGPT

User-agent: ClaudeBot
Disallow: /          # ← Bloque Claude

User-agent: *
Disallow: /          # ← Bloque TOUT, y compris les IA

User-agent: CCBot
Disallow: /          # ← Bloque les crawlers Common Crawl
                     #   (utilisés par beaucoup de LLMs)

Le robots.txt idéal pour la visibilité IA

Voici un robots.txt complet qui autorise explicitement tous les crawlers IA importants. Copiez-le et adaptez les URLs à votre domaine :

# robots.txt — optimisé pour la visibilité IA
# Généré par RadarLLM.ai

# Google (recherche classique)
User-agent: Googlebot
Allow: /

# Google (IA / Gemini / AI Overviews)
User-agent: Google-Extended
Allow: /

# OpenAI (ChatGPT)
User-agent: GPTBot
Allow: /

# OpenAI (ChatGPT Search)
User-agent: OAI-SearchBot
Allow: /

# OpenAI (navigation utilisateur ChatGPT)
User-agent: ChatGPT-User
Allow: /

# Anthropic (Claude)
User-agent: ClaudeBot
Allow: /
User-agent: anthropic-ai
Allow: /

# Perplexity
User-agent: PerplexityBot
Allow: /

# Bing
User-agent: Bingbot
Allow: /

# DuckDuckGo AI
User-agent: DuckAssistBot
Allow: /

# Cohere
User-agent: cohere-ai
Allow: /

# Tous les autres bots
User-agent: *
Allow: /
Disallow: /admin/
Disallow: /api/
Disallow: /private/

# Sitemap
Sitemap: https://votre-site.com/sitemap.xml

Conseil : RadarLLM génère automatiquement un robots.txt optimisé pour votre site lors de chaque audit. Le fichier est inclus dans le ZIP de correctifs.

Les pièges courants

Même si votre robots.txt semble correct, d'autres couches peuvent bloquer les crawlers IA :

01

Plugins de sécurité WordPress

Wordfence, Sucuri et iThemes Security ajoutent souvent des règles bloquant les bots IA dans votre robots.txt sans vous prévenir. Vérifiez la section "Blocage de bots" de votre plugin après chaque mise à jour.

02

Cloudflare "Bot Fight Mode"

Le mode Bot Fight de Cloudflare bloque les crawlers IA légitimes en les identifiant comme des menaces. Désactivez-le ou ajoutez des exceptions pour GPTBot, ClaudeBot et PerplexityBot dans vos règles WAF.

03

Blocage IP au niveau CDN

Certains CDN et hébergeurs bloquent les plages IP utilisées par les crawlers IA. Ce blocage est invisible dans votre robots.txt. Vérifiez vos logs serveur pour détecter des requêtes bloquées (403).

04

Règles wildcard trop larges

Une règle "User-agent: * / Disallow: /admin/" semble inoffensive, mais certains hébergeurs ajoutent "Disallow: /" pour tous les agents non reconnus. Vérifiez que votre wildcard n'est pas trop restrictif.

Que faire après avoir corrigé votre robots.txt

Corriger le robots.txt est la première étape. Voici ce qui vient ensuite :

01

Attendez 4 à 8 semaines

Les crawlers IA ne repassent pas immédiatement. Après correction, comptez 4 à 8 semaines pour que GPTBot, ClaudeBot et PerplexityBot re-indexent votre site.

02

Surveillez avec RadarLLM

Lancez un audit de visibilité IA pour voir quels LLMs vous citent déjà. Refaites un audit après 8 semaines pour mesurer la progression.

03

Ajoutez des données structurées

Le robots.txt ouvre la porte. Les schemas JSON-LD (FAQPage, Organization) aident les IA à comprendre et citer votre contenu. Implémentez-les en priorité.

04

Créez un fichier llms.txt

Le robots.txt dit aux IA ce qu'elles peuvent explorer. Le llms.txt leur dit qui vous êtes. Les deux fichiers sont complémentaires et essentiels en 2026.

Votre robots.txt bloque-t-il les IA ?

Scanner mon site gratuitement

Scan gratuit en moins d’une minute · Fichiers correctifs avec l’audit complet