Deux lignes suffisent à sortir un site entier de Google : User-agent: * puis Disallow: /. Nous les retrouvons régulièrement sur des sites « terminés » depuis des mois, oubliées après la mise en ligne. Voici comment fonctionne ce petit fichier, et comment vérifier le vôtre en cinq minutes.
En bref : le robots.txt est un fichier texte placé à la racine du site qui indique aux robots des moteurs quelles adresses ils peuvent explorer. Il sert à gérer l'exploration, pas à cacher une page : Google précise qu'une page bloquée peut quand même être indexée si d'autres sites la citent. Google ne lit que quatre instructions (user-agent, allow, disallow, sitemap) ; noindex et crawl-delay y sont ignorés. Une seule ligne de trop peut bloquer tout un site : le rapport robots.txt de la Search Console permet de le vérifier gratuitement.
C'est l'un des premiers fichiers que nous contrôlons lors d'un audit de référencement naturel : rarement la cause d'un bon classement, souvent celle d'une disparition.
Le fichier se trouve toujours à la même adresse : votresite.fr/robots.txt. Avant d'explorer un site, les robots bien élevés — Googlebot, Bingbot, les robots des IA — le lisent pour savoir où ils peuvent aller. Selon la documentation de Google, son rôle premier est de gérer le trafic des robots, par exemple pour éviter qu'ils ne surchargent le serveur ou perdent leur temps dans des zones sans intérêt.
Pour un site de TPE, trois usages sont vraiment utiles :
Sans fichier robots.txt, rien de grave : Google considère simplement que tout peut être exploré.
La spécification de Google, alignée sur le standard RFC 9309, tient en peu de règles :
| Instruction | Rôle |
|---|---|
User-agent | Le robot concerné (* pour tous). Ouvre un groupe de règles. |
Disallow | Chemin interdit à l'exploration. |
Allow | Exception autorisée à l'intérieur d'un chemin interdit. |
Sitemap | Adresse complète du sitemap, indépendante des groupes. |
# Tous les robots : tout est permis sauf deux zones
User-agent: *
Disallow: /recherche/
Disallow: /*?tri=
Allow: /recherche/aide.html
Sitemap: https://www.votresite.fr/sitemap.xml
* remplace n'importe quelle suite de caractères, $ marque la fin de l'adresse (Disallow: /*.pdf$)./Admin/ et /admin/ sont deux règles différentes.User-agent: Googlebot remplace entièrement le groupe * pour Googlebot.noindex dans le fichier. Google a cessé de tenir compte de cette instruction non documentée le 1er septembre 2019 (annonce de Google).Crawl-delay n'est pas pris en charge par Google./espace-client/ indique où chercher. Les zones privées se protègent par mot de passe côté serveur.Votre site est-il bloqué sans que vous le sachiez ?L'audit gratuit de cette page vérifie en 20 secondes la vitesse, les balises et l'indexabilité. Charles vous rappelle ensuite si quelque chose empêche Google d'explorer vos pages.
Tester mon site gratuitementDisallow: / de la préproduction, conservé après la mise en ligne. Symptôme : un site neuf qui n'apparaît jamais — voir pourquoi mon site n'apparaît pas sur Google.Disallow: /blog bloque aussi /blog-actualites/ et /blogueurs.html, puisque la règle s'applique à tout ce qui commence ainsi.* ne s'y appliquent plus.Tous ces rapports sont présentés dans notre guide de la Search Console.
Notre fichier est public : bapst-technologies.com/robots.txt. Il tient en une vingtaine de lignes :
User-agent: * qui autorise tout, sauf le script d'envoi des formulaires ;Sitemap avec l'adresse complète.Aucune page n'y est « cachée » : ce qui ne doit pas être indexé porte une balise noindex. C'est la même logique que nous appliquons aux sites de nos clients, dans l'Ain — à Bourg-en-Bresse, Montluel — comme à distance, dans le cadre de notre accompagnement SEO. Pour aller plus loin, le budget de crawl et la balise meta robots sont définis dans le lexique.
Un site a-t-il obligatoirement besoin d'un robots.txt ?
Non. Sans fichier robots.txt, Google considère que tout le site peut être exploré. Le fichier devient utile pour éviter l'exploration de zones sans intérêt, indiquer l'adresse du sitemap ou régler l'accès de certains robots.
Comment retirer une page de Google avec le robots.txt ?
On ne le fait pas avec le robots.txt. Une page bloquée peut rester dans les résultats si d'autres sites la citent. Il faut au contraire la laisser explorable et lui ajouter une balise meta robots noindex, ou la protéger par mot de passe.
Combien de temps pour qu'une modification du robots.txt soit prise en compte ?
Google met généralement le fichier en cache jusqu'à 24 heures. Pour accélérer après une correction importante, la Search Console permet de demander une nouvelle exploration du robots.txt depuis son rapport dédié.
Le robots.txt protège-t-il des pages confidentielles ?
Non. Le fichier est public et seuls les robots respectueux le suivent. Lister une zone sensible revient même à indiquer où elle se trouve. Les pages privées doivent être protégées par un mot de passe côté serveur.
Entrez l'adresse de votre site : on analyse en direct sa vitesse et son SEO technique, puis Charles vous rappelle si un blocage empêche Google de voir vos pages.
Robots.txt, indexation, sitemap, redirections : notre agence de référencement naturel remet les fondations techniques d'aplomb avant tout le reste. Réponse personnelle sous 2 h en jours ouvrés.