Robots d'IA
faut-il les bloquer ?

GPTBot, ClaudeBot, PerplexityBot, Google-Extended : les journaux des serveurs se remplissent de nouveaux visiteurs. Certains conseillent de tout bloquer, d'autres de tout ouvrir. La bonne décision dépend d'une distinction que peu de gens font.

En bref : les entreprises d'IA utilisent des robots différents pour entraîner leurs modèles et pour chercher des sources en direct quand elles répondent. Bloquer les robots de recherche rend votre site invisible dans leurs réponses ; bloquer les robots d'entraînement est un choix distinct, à faire en connaissance de cause. Pour une entreprise qui veut être recommandée, le réglage raisonnable est d'autoriser les robots de recherche, et de décider au cas par cas pour l'entraînement.

Sur notre propre site, nous autorisons l'ensemble de ces robots : nous vendons de la visibilité, y compris dans les IA, et nos pages publiques n'ont rien à cacher. Notre fichier est consultable à l'adresse bapst-technologies.com/robots.txt ; il sert d'exemple commenté plus bas.

GPTBot, ClaudeBot, PerplexityBot : faut-il bloquer les robots d'IA ? — illustration avec Lysara

Deux familles de robots : entraînement et recherche

Qui fait quoi

ÉditeurNom du robotUsage déclaré
OpenAIOAI-SearchBotFaire apparaître des sites dans les résultats de recherche de ChatGPT
GPTBotCollecte pour l'entraînement des modèles
ChatGPT-UserVisites déclenchées par un utilisateur
AnthropicClaude-SearchBotRecherche, pour la qualité des réponses de Claude
ClaudeBotCollecte pour l'entraînement des modèles
Claude-UserVisites déclenchées par un utilisateur
PerplexityPerplexityBotIndexation pour les réponses de Perplexity
Perplexity-UserVisites déclenchées par un utilisateur
GoogleGooglebotRecherche Google, aperçus IA compris
Google-ExtendedPas un robot : un jeton qui contrôle l'usage du contenu pour entraîner Gemini et ancrer ses réponses
Common CrawlCCBotCorpus ouvert du web, utilisé par de nombreux projets d'IA

Sources : les pages officielles d'OpenAI, d'Anthropic, de Perplexity, de Google et de Common Crawl. Les noms évoluent : d'anciens agents disparaissent, de nouveaux apparaissent — un robots.txt se relit au moins une fois par an.

Ce que coûte un blocage

Votre site laisse-t-il passer les bons robots ?L'audit gratuit de cette page vérifie en 20 secondes l'indexabilité, la vitesse et les balises. Charles vous rappelle ensuite avec les réglages robots.txt adaptés à votre activité.

Tester mon site gratuitement

Le réglage que nous recommandons à une entreprise

Pour une entreprise qui veut être trouvée et recommandée, notre recommandation est simple : tout autoriser sur les pages publiques, protéger les zones techniques pour tous les robots, et documenter les choix dans le fichier. Voici l'essentiel du nôtre :

# Tout est ouvert, sauf le script d'envoi des formulaires.
User-agent: *
Allow: /
Disallow: /send-mail.php

# Robots d'IA : recherche, visites utilisateurs et entraînement autorisés.
# Un groupe dédié remplace le groupe « * » pour ces robots :
# les exclusions doivent donc y être répétées.
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: GPTBot
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: ClaudeBot
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: Google-Extended
User-agent: CCBot
Allow: /
Disallow: /send-mail.php

Sitemap: https://bapst-technologies.com/sitemap.xml

Le détail qui piège souvent : selon le standard du robots.txt, un robot applique uniquement le groupe qui le désigne le plus précisément. Si vous créez un groupe pour GPTBot sans y recopier vos interdictions, GPTBot ne les voit plus. D'où la répétition de la ligne Disallow.

Vous vendez du contenu, des formations ou des données ? Remplacez simplement Allow: / par Disallow: / dans un groupe réservé à GPTBot, ClaudeBot, CCBot et Google-Extended, tout en laissant ouverts les robots de recherche. Les bases du fichier sont dans la documentation Google sur le robots.txt et dans la définition du lexique.

Vérifier que les robots passent vraiment

  1. Relisez votre robots.txt en entier. Un vieux Disallow: / hérité d'une mise en ligne ou d'un ancien prestataire suffit à tout fermer.
  2. Vérifiez votre hébergeur et votre CDN. Des services comme Cloudflare proposent — et activent parfois par défaut — le blocage des robots d'IA : le réglage se fait dans leur interface, pas dans le robots.txt.
  3. Consultez les journaux du serveur. L'analyse de logs montre quels robots viennent, sur quelles pages, et avec quelle réponse du serveur.
  4. Mesurez les visites venues des IA. Le trafic référent depuis chatgpt.com ou perplexity.ai apparaît dans vos statistiques : c'est la preuve que la porte est ouverte et que vous êtes cité.

Le robots.txt n'est pas un mur

Le robots.txt est une convention : les robots des grands éditeurs déclarent la respecter, mais rien ne l'impose techniquement, et des cas de robots non déclarés ont été documentés. Pour protéger réellement un contenu, il faut une authentification ou un blocage côté serveur. À l'inverse, pour être lu, il faut plus qu'une porte ouverte : des pages explorables, rapides, sans dépendance au JavaScript, et des contenus qui méritent d'être cités.

C'est tout l'objet du référencement IA, que nous construisons par-dessus le socle de notre agence SEO dans l'Ain — à Bourg-en-Bresse, Montluel ou à distance. Et pour présenter votre site aux outils d'IA une fois la porte ouverte, voir notre guide sur le fichier llms.txt.

Questions fréquentes

Bloquer GPTBot retire-t-il mon site de ChatGPT ?
Pas de la recherche de ChatGPT. OpenAI distingue GPTBot, utilisé pour l'entraînement de ses modèles, et OAI-SearchBot, utilisé pour faire apparaître des sites dans les résultats de recherche de ChatGPT. On peut bloquer le premier et autoriser le second.

Google-Extended a-t-il un effet sur mon référencement Google ?
Non. D'après la documentation de Google, Google-Extended permet seulement de refuser que le contenu serve à entraîner les modèles Gemini et à ancrer les réponses des applications Gemini et de Vertex AI. Il n'a aucun effet sur l'inclusion ni sur le classement dans la recherche Google.

Mon site peut-il bloquer les IA sans que je le sache ?
Oui. Un robots.txt hérité d'un ancien prestataire, un pare-feu applicatif ou un service comme Cloudflare peuvent bloquer des robots d'IA. Vérifiez le robots.txt, les réglages de protection contre les robots de votre hébergeur ou de votre CDN, et les journaux du serveur.

Faut-il un fichier llms.txt en plus du robots.txt ?
Ce n'est pas indispensable. Le robots.txt décide qui peut lire le site ; llms.txt, qui n'est qu'une proposition de standard, présente le site aux outils qui le consultent. C'est une finition peu coûteuse, à poser après les fondations.

Classé dansWeb, SEO & digitalGEO (référencement IA)IASEO technique

À lire aussi : le fichier llms.txt, le référencement IA (GEO), « détectée, actuellement non indexée » et le lexique SEO & GEO. Nouveaux guides : la visibilité IA et le robots.txt.

Audit gratuit

Les robots peuvent-ils lire votre site ?

Entrez l'adresse de votre site : on analyse en direct sa vitesse et son SEO technique, puis Charles vous rappelle avec les réglages à corriger pour Google comme pour les IA.

Invisible dans les IA ?

Ouvrez la porte aux bons robots

Robots.txt, données structurées, contenus citables, suivi des citations : notre offre de référencement IA règle tout, dans le bon ordre. Réponse personnelle sous 2 h en jours ouvrés.