GEO — Recherche IAFichier robots.txt affichant des règles pour différents robots d'indexation IA

Bloquer ou laisser entrer les robots IA : le vrai calcul

Mis à jour le 8 septembre 2026

Pour un restaurant qui cherche à être vu, bloquer les robots des IA génératives (GPTBot, ClaudeBot, PerplexityBot) dans le fichier robots.txt revient à s'exclure volontairement des réponses de ChatGPT, Claude et Perplexity. Sauf raison spécifique de confidentialité ou de protection de contenu, laisser ces robots accéder au site est la position par défaut cohérente avec un objectif de visibilité.

Les robots concernés

User-agentÉditeurUsage
GPTBotOpenAIEntraînement et récupération de contenu pour ChatGPT
OAI-SearchBotOpenAIRecherche en temps réel pour ChatGPT
ChatGPT-UserOpenAINavigation déclenchée par un utilisateur ChatGPT
ClaudeBotAnthropicEntraînement et récupération pour Claude
Claude-SearchBotAnthropicRecherche en temps réel pour Claude
PerplexityBotPerplexityRécupération de contenu pour les réponses Perplexity
Google-ExtendedGoogleContrôle l'usage du contenu pour les fonctionnalités génératives Google (distinct du crawl Search classique)
Applebot-ExtendedAppleContrôle l'usage du contenu pour les fonctionnalités IA Apple

Ce que bloquer ces robots empêche concrètement

Un robot bloqué dans robots.txt ne peut pas lire le contenu de vos pages. Concrètement, votre établissement ne pourra pas être cité, mentionné ou décrit avec précision par le modèle correspondant, puisqu'il n'a tout simplement pas accès au texte de votre fiche ou de votre site pour se former une opinion informée.

C'est différent d'un blocage involontaire : de nombreux sites bloquent ces robots sans le savoir, via des règles anti-bot génériques au niveau du serveur (WAF, fail2ban, règles nginx trop larges) qui ne distinguent pas un robot IA légitime d'un robot malveillant. C'est la panne silencieuse la plus fréquente : le site « fonctionne » pour un visiteur humain, mais les robots IA reçoivent une erreur 403 sans que personne ne s'en aperçoive.

Comment vérifier que vos robots ne sont pas bloqués

  1. Consultez directement votre fichier robots.txt (accessible à votredomaine.fr/robots.txt) et vérifiez qu'aucune règle Disallow: / n'existe pour ces user-agents.
  2. Consultez les logs d'accès du serveur (access_log nginx) et cherchez ces user-agents avec grep -E "GPTBot|ChatGPT-User|ClaudeBot|PerplexityBot" access.log — leur présence confirme qu'ils accèdent bien au site.
  3. Si vous utilisez un WAF ou un service anti-bot tiers, vérifiez sa configuration spécifiquement pour ces user-agents, car les règles par défaut de certains fournisseurs les bloquent globalement.

Les rares cas où bloquer a du sens

  • Contenu sous licence stricte que vous ne souhaitez pas voir réutilisé pour entraîner des modèles tiers.
  • Pages contenant des informations sensibles ou privées qui ne devraient jamais être publiquement synthétisées.
  • Stratégie commerciale délibérée de ne pas être visible via les canaux IA (rare, et généralement pas pertinent pour un commerce local qui cherche des clients).

Pour un restaurant en croissance, aucun de ces cas ne s'applique généralement — la visibilité prime.


Pour le contexte complet sur pourquoi cette visibilité compte, voir apparaître dans ChatGPT quand un client cherche un restaurant.

SEOresto s'assure que votre présence en ligne reste accessible aux robots qui comptent, IA comme Google. À partir de 39 €/mois. Voir les tarifs.


Sources : documentation publique des user-agents GPTBot (OpenAI), ClaudeBot (Anthropic), PerplexityBot (Perplexity), Google-Extended (Google), Applebot-Extended (Apple).

Auteur : Dmitrii Portnov, fondateur de SEOresto.

Read this article in English →

Articles connexes

← Retour au blog