Robots.txt
le fichier qui peut rendre invisible

Deux lignes suffisent à sortir un site entier de Google : User-agent: * puis Disallow: /. Nous les retrouvons régulièrement sur des sites « terminés » depuis des mois, oubliées après la mise en ligne. Voici comment fonctionne ce petit fichier, et comment vérifier le vôtre en cinq minutes.

En bref : le robots.txt est un fichier texte placé à la racine du site qui indique aux robots des moteurs quelles adresses ils peuvent explorer. Il sert à gérer l'exploration, pas à cacher une page : Google précise qu'une page bloquée peut quand même être indexée si d'autres sites la citent. Google ne lit que quatre instructions (user-agent, allow, disallow, sitemap) ; noindex et crawl-delay y sont ignorés. Une seule ligne de trop peut bloquer tout un site : le rapport robots.txt de la Search Console permet de le vérifier gratuitement.

C'est l'un des premiers fichiers que nous contrôlons lors d'un audit de référencement naturel : rarement la cause d'un bon classement, souvent celle d'une disparition.

Robots.txt : le fichier qui peut rendre votre site invisible — illustration avec Lysara

À quoi sert le robots.txt

Le fichier se trouve toujours à la même adresse : votresite.fr/robots.txt. Avant d'explorer un site, les robots bien élevés — Googlebot, Bingbot, les robots des IA — le lisent pour savoir où ils peuvent aller. Selon la documentation de Google, son rôle premier est de gérer le trafic des robots, par exemple pour éviter qu'ils ne surchargent le serveur ou perdent leur temps dans des zones sans intérêt.

Pour un site de TPE, trois usages sont vraiment utiles :

Sans fichier robots.txt, rien de grave : Google considère simplement que tout peut être exploré.

La syntaxe que Google comprend

La spécification de Google, alignée sur le standard RFC 9309, tient en peu de règles :

InstructionRôle
User-agentLe robot concerné (* pour tous). Ouvre un groupe de règles.
DisallowChemin interdit à l'exploration.
AllowException autorisée à l'intérieur d'un chemin interdit.
SitemapAdresse complète du sitemap, indépendante des groupes.
# Tous les robots : tout est permis sauf deux zones
User-agent: *
Disallow: /recherche/
Disallow: /*?tri=
Allow: /recherche/aide.html

Sitemap: https://www.votresite.fr/sitemap.xml

Ce que le robots.txt ne sait pas faire

Votre site est-il bloqué sans que vous le sachiez ?L'audit gratuit de cette page vérifie en 20 secondes la vitesse, les balises et l'indexabilité. Charles vous rappelle ensuite si quelque chose empêche Google d'explorer vos pages.

Tester mon site gratuitement

Les 6 erreurs qui bloquent un site

  1. Le Disallow: / de la préproduction, conservé après la mise en ligne. Symptôme : un site neuf qui n'apparaît jamais — voir pourquoi mon site n'apparaît pas sur Google.
  2. Bloquer les fichiers CSS et JavaScript. Google ne peut plus afficher la page comme un visiteur et la juge mal, notamment sur mobile.
  3. Bloquer une page pour la faire disparaître, au lieu d'utiliser noindex ou une redirection 301.
  4. Une règle trop large : Disallow: /blog bloque aussi /blog-actualites/ et /blogueurs.html, puisque la règle s'applique à tout ce qui commence ainsi.
  5. Un groupe dédié qui oublie les interdictions générales : les règles du groupe * ne s'y appliquent plus.
  6. Un robots.txt en erreur serveur. Si le fichier renvoie une erreur 5xx, Google suspend l'exploration du site pendant 12 heures, puis s'appuie sur la dernière version en cache ; une erreur 404, elle, est traitée comme l'absence de fichier (codes de statut HTTP).

Tester son fichier dans la Search Console

Tous ces rapports sont présentés dans notre guide de la Search Console.

Notre robots.txt commenté

Notre fichier est public : bapst-technologies.com/robots.txt. Il tient en une vingtaine de lignes :

Aucune page n'y est « cachée » : ce qui ne doit pas être indexé porte une balise noindex. C'est la même logique que nous appliquons aux sites de nos clients, dans l'Ain — à Bourg-en-Bresse, Montluel — comme à distance, dans le cadre de notre accompagnement SEO. Pour aller plus loin, le budget de crawl et la balise meta robots sont définis dans le lexique.

Questions fréquentes

Un site a-t-il obligatoirement besoin d'un robots.txt ?
Non. Sans fichier robots.txt, Google considère que tout le site peut être exploré. Le fichier devient utile pour éviter l'exploration de zones sans intérêt, indiquer l'adresse du sitemap ou régler l'accès de certains robots.

Comment retirer une page de Google avec le robots.txt ?
On ne le fait pas avec le robots.txt. Une page bloquée peut rester dans les résultats si d'autres sites la citent. Il faut au contraire la laisser explorable et lui ajouter une balise meta robots noindex, ou la protéger par mot de passe.

Combien de temps pour qu'une modification du robots.txt soit prise en compte ?
Google met généralement le fichier en cache jusqu'à 24 heures. Pour accélérer après une correction importante, la Search Console permet de demander une nouvelle exploration du robots.txt depuis son rapport dédié.

Le robots.txt protège-t-il des pages confidentielles ?
Non. Le fichier est public et seuls les robots respectueux le suivent. Lister une zone sensible revient même à indiquer où elle se trouve. Les pages privées doivent être protégées par un mot de passe côté serveur.

Classé dansWeb, SEO & digitalSEO technique

À lire aussi : le sitemap XML, les robots d'IA, « détectée, actuellement non indexée » et le lexique SEO & GEO.

Audit gratuit

Google peut-il explorer votre site ?

Entrez l'adresse de votre site : on analyse en direct sa vitesse et son SEO technique, puis Charles vous rappelle si un blocage empêche Google de voir vos pages.

Un site introuvable ?

On débloque, puis on fait monter

Robots.txt, indexation, sitemap, redirections : notre agence de référencement naturel remet les fondations techniques d'aplomb avant tout le reste. Réponse personnelle sous 2 h en jours ouvrés.