GPTBot, ClaudeBot, PerplexityBot, Google-Extended : les journaux des serveurs se remplissent de nouveaux visiteurs. Certains conseillent de tout bloquer, d'autres de tout ouvrir. La bonne décision dépend d'une distinction que peu de gens font.
En bref : les entreprises d'IA utilisent des robots différents pour entraîner leurs modèles et pour chercher des sources en direct quand elles répondent. Bloquer les robots de recherche rend votre site invisible dans leurs réponses ; bloquer les robots d'entraînement est un choix distinct, à faire en connaissance de cause. Pour une entreprise qui veut être recommandée, le réglage raisonnable est d'autoriser les robots de recherche, et de décider au cas par cas pour l'entraînement.
Sur notre propre site, nous autorisons l'ensemble de ces robots : nous vendons de la visibilité, y compris dans les IA, et nos pages publiques n'ont rien à cacher. Notre fichier est consultable à l'adresse bapst-technologies.com/robots.txt ; il sert d'exemple commenté plus bas.
| Éditeur | Nom du robot | Usage déclaré |
|---|---|---|
| OpenAI | OAI-SearchBot | Faire apparaître des sites dans les résultats de recherche de ChatGPT |
GPTBot | Collecte pour l'entraînement des modèles | |
ChatGPT-User | Visites déclenchées par un utilisateur | |
| Anthropic | Claude-SearchBot | Recherche, pour la qualité des réponses de Claude |
ClaudeBot | Collecte pour l'entraînement des modèles | |
Claude-User | Visites déclenchées par un utilisateur | |
| Perplexity | PerplexityBot | Indexation pour les réponses de Perplexity |
Perplexity-User | Visites déclenchées par un utilisateur | |
Googlebot | Recherche Google, aperçus IA compris | |
Google-Extended | Pas un robot : un jeton qui contrôle l'usage du contenu pour entraîner Gemini et ancrer ses réponses | |
| Common Crawl | CCBot | Corpus ouvert du web, utilisé par de nombreux projets d'IA |
Sources : les pages officielles d'OpenAI, d'Anthropic, de Perplexity, de Google et de Common Crawl. Les noms évoluent : d'anciens agents disparaissent, de nouveaux apparaissent — un robots.txt se relit au moins une fois par an.
Votre site laisse-t-il passer les bons robots ?L'audit gratuit de cette page vérifie en 20 secondes l'indexabilité, la vitesse et les balises. Charles vous rappelle ensuite avec les réglages robots.txt adaptés à votre activité.
Tester mon site gratuitementPour une entreprise qui veut être trouvée et recommandée, notre recommandation est simple : tout autoriser sur les pages publiques, protéger les zones techniques pour tous les robots, et documenter les choix dans le fichier. Voici l'essentiel du nôtre :
# Tout est ouvert, sauf le script d'envoi des formulaires.
User-agent: *
Allow: /
Disallow: /send-mail.php
# Robots d'IA : recherche, visites utilisateurs et entraînement autorisés.
# Un groupe dédié remplace le groupe « * » pour ces robots :
# les exclusions doivent donc y être répétées.
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: GPTBot
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: ClaudeBot
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: Google-Extended
User-agent: CCBot
Allow: /
Disallow: /send-mail.php
Sitemap: https://bapst-technologies.com/sitemap.xml
Le détail qui piège souvent : selon le standard du robots.txt, un robot applique uniquement le groupe qui le désigne le plus précisément. Si vous créez un groupe pour GPTBot sans y recopier vos interdictions, GPTBot ne les voit plus. D'où la répétition de la ligne Disallow.
Vous vendez du contenu, des formations ou des données ? Remplacez simplement Allow: / par Disallow: / dans un groupe réservé à GPTBot, ClaudeBot, CCBot et Google-Extended, tout en laissant ouverts les robots de recherche. Les bases du fichier sont dans la documentation Google sur le robots.txt et dans la définition du lexique.
Disallow: / hérité d'une mise en ligne ou d'un ancien prestataire suffit à tout fermer.Le robots.txt est une convention : les robots des grands éditeurs déclarent la respecter, mais rien ne l'impose techniquement, et des cas de robots non déclarés ont été documentés. Pour protéger réellement un contenu, il faut une authentification ou un blocage côté serveur. À l'inverse, pour être lu, il faut plus qu'une porte ouverte : des pages explorables, rapides, sans dépendance au JavaScript, et des contenus qui méritent d'être cités.
C'est tout l'objet du référencement IA, que nous construisons par-dessus le socle de notre agence SEO dans l'Ain — à Bourg-en-Bresse, Montluel ou à distance. Et pour présenter votre site aux outils d'IA une fois la porte ouverte, voir notre guide sur le fichier llms.txt.
Bloquer GPTBot retire-t-il mon site de ChatGPT ?
Pas de la recherche de ChatGPT. OpenAI distingue GPTBot, utilisé pour l'entraînement de ses modèles, et OAI-SearchBot, utilisé pour faire apparaître des sites dans les résultats de recherche de ChatGPT. On peut bloquer le premier et autoriser le second.
Google-Extended a-t-il un effet sur mon référencement Google ?
Non. D'après la documentation de Google, Google-Extended permet seulement de refuser que le contenu serve à entraîner les modèles Gemini et à ancrer les réponses des applications Gemini et de Vertex AI. Il n'a aucun effet sur l'inclusion ni sur le classement dans la recherche Google.
Mon site peut-il bloquer les IA sans que je le sache ?
Oui. Un robots.txt hérité d'un ancien prestataire, un pare-feu applicatif ou un service comme Cloudflare peuvent bloquer des robots d'IA. Vérifiez le robots.txt, les réglages de protection contre les robots de votre hébergeur ou de votre CDN, et les journaux du serveur.
Faut-il un fichier llms.txt en plus du robots.txt ?
Ce n'est pas indispensable. Le robots.txt décide qui peut lire le site ; llms.txt, qui n'est qu'une proposition de standard, présente le site aux outils qui le consultent. C'est une finition peu coûteuse, à poser après les fondations.
Entrez l'adresse de votre site : on analyse en direct sa vitesse et son SEO technique, puis Charles vous rappelle avec les réglages à corriger pour Google comme pour les IA.
Robots.txt, données structurées, contenus citables, suivi des citations : notre offre de référencement IA règle tout, dans le bon ordre. Réponse personnelle sous 2 h en jours ouvrés.