Votre site bloque-t-il ChatGPT à votre insu ?
Vous pouvez avoir un excellent site et ne jamais apparaître dans une réponse de ChatGPT ou de Perplexity. La cause se trouve alors souvent dans un petit fichier texte que presque personne n'ouvre : robots.txt. Une seule ligne suffit à refuser à un service d'IA l'accès à tout votre site. Vous lirez ci-dessous comment cela fonctionne, quels crawlers existent et quel choix faire en connaissance de cause.
Ce que fait robots.txt
Robots.txt est un fichier d'instructions pour les crawlers, les programmes qui lisent automatiquement les sites web. Selon la norme officielle RFC 9309, le fichier doit s'appeler exactement robots.txt et se trouver à la racine de votre domaine. Vous le trouvez donc à l'adresse votredomaine.be/robots.txt.
Le fichier indique pour chaque crawler, désigné par « User-agent », quelles parties du site il peut lire. Une ligne « Disallow: / » signifie : rien. Dans son introduction à robots.txt, Google souligne deux limites. Le fichier sert à gérer le trafic des crawlers et n'exclut pas une page des résultats de recherche. De plus, les crawlers respectables suivent les instructions, alors que d'autres crawlers ne le font peut-être pas. Robots.txt fonctionne donc comme un accord que les crawlers respectent volontairement.
Les crawlers IA connus
Les grandes entreprises d'IA utilisent généralement plusieurs crawlers, chacun avec son propre objectif. Pour une PME, la distinction entre entraînement et recherche est la plus importante.
OpenAI décrit trois noms dans son aperçu des crawlers :
- GPTBot collecte du contenu pour entraîner des modèles. Si vous le bloquez, vous indiquez que votre contenu ne peut pas servir à l'entraînement.
- OAI-SearchBot lit les sites pour les afficher dans les réponses de recherche de ChatGPT. Selon OpenAI, les sites qui le bloquent n'apparaissent pas dans ces réponses.
- ChatGPT-User récupère une page lorsqu'un utilisateur le demande. OpenAI écrit que robots.txt ne s'applique peut-être pas ici, parce que l'action vient d'un utilisateur.
Perplexity utilise deux noms selon sa documentation sur les crawlers :
- PerplexityBot recherche et référence des sites web dans les résultats de Perplexity et n'est pas utilisé pour entraîner des modèles, selon l'entreprise. Il respecte robots.txt.
- Perplexity-User visite des pages lorsqu'un utilisateur pose une question et ignore généralement robots.txt selon Perplexity, puisque c'est un utilisateur qui a donné l'instruction.
Anthropic, l'entreprise derrière Claude, décrit trois noms dans son article d'aide sur les crawlers :
- ClaudeBot collecte du contenu qui peut contribuer à l'entraînement des modèles.
- Claude-SearchBot lit du contenu pour améliorer les résultats de recherche de Claude. Le bloquer peut réduire votre visibilité dans ces résultats.
- Claude-User récupère des pages lorsqu'un utilisateur pose une question à Claude.
Google utilise un nom distinct : Google-Extended. Selon la liste des crawlers de Google, il vous permet de décider si le contenu que Google explore peut servir à entraîner les futurs modèles Gemini. Google écrit explicitement que Google-Extended n'a aucune influence sur votre inclusion dans Google Search et n'est pas un signal de classement. Selon les explications de Google sur les fonctionnalités d'IA, votre présence dans AI Overviews dépend de l'indexation ordinaire : votre page doit figurer dans Google Search et pouvoir apparaître avec un extrait.
Ce que bloquer implique
Les conséquences varient fortement d'un crawler à l'autre :
- Si vous bloquez un crawler d'entraînement comme GPTBot, ClaudeBot ou Google-Extended, vous demandez que votre contenu ne se retrouve pas dans de futurs modèles. Selon la documentation de ces entreprises, cela n'a rien à voir avec votre visibilité dans leurs fonctions de recherche.
- Si vous bloquez un crawler de recherche comme OAI-SearchBot, PerplexityBot ou Claude-SearchBot, vous disparaissez en grande partie des réponses de ce service.
- Une règle générale « User-agent: * » avec « Disallow: / » bloque tous les crawlers qui la respectent, Googlebot compris.
Ce dernier cas se rencontre sur des sites encore en développement dont le blocage est resté en place après le lancement. Parfois, un plug-in ou un service de sécurité ajoute automatiquement des règles. Un pare-feu peut aussi écarter les crawlers IA sans que rien ne figure dans robots.txt : contrôler le fichier seul ne suffit donc pas toujours.
Ce que vous choisissez en conscience
Pour la plupart des PME, le choix logique consiste à autoriser les crawlers de recherche, parce que vous voulez être trouvé par ceux qui cherchent un fournisseur via ChatGPT ou Perplexity. Sur les crawlers d'entraînement, les avis peuvent diverger. Qui publie un contenu unique sur lequel repose son modèle économique, comme un éditeur ou un organisme de formation, peut les écarter. Pour un installateur, un cabinet d'avocats ou un grossiste, cet argument pèse généralement moins lourd.
Un robots.txt qui autorise les crawlers de recherche et refuse l'entraînement ressemble à ceci :
``` User-agent: OAI-SearchBot Allow: /
User-agent: PerplexityBot Allow: /
User-agent: Claude-SearchBot Allow: /
User-agent: GPTBot Disallow: /
User-agent: ClaudeBot Disallow: /
User-agent: Google-Extended Disallow: / ```
Plus important que le choix exact : le faire vous-même et le consigner, pour qu'un prochain développeur web ne l'annule pas sans s'en rendre compte. Nous examinons ce fichier lors de chaque analyse, avec les réglages du pare-feu, pour des PME de Gand et du reste de la Flandre.
Ce que vous pouvez faire dès maintenant
- Ouvrez votredomaine.be/robots.txt et cherchez les noms cités dans cet article ainsi que « Disallow: / ».
- Demandez à votre développeur web ou à votre hébergeur s'il existe un pare-feu ou un service de sécurité qui écarte les bots. Demandez aussi si les crawlers IA sont concernés.
- Décidez pour chaque type de crawler (recherche ou entraînement) ce que vous voulez autoriser et consignez ce choix.
Faites-le vérifier dans l'analyse IA gratuite. Votre site sera bientôt renouvelé ? Transmettez aussi ces accords à notre agence sœur hetdesignbureau.be.
Sources
- RFC 9309 : Robots Exclusion Protocol (IETF)
- Introduction to robots.txt (Google Search Central)
- Overview of OpenAI Crawlers (OpenAI)
- Perplexity Crawlers (Perplexity)
- Does Anthropic crawl data from the web, and how can site owners block the crawler ? (Claude Help Center)
- Google's common crawlers (Google Search Central)
- AI features and your website (Google Search Central)