aslain.dev
0%
01 Hizmetler 02 Hakkımda 03 Projeler 04 Stack 05 Blog 06 İletişim
← Tüm makaleler SEO & Marketing

robots.txt : configuration correcte et erreurs courantes

Un fichier robots txt est un petit fichier texte mais essentiel qui indique aux robots des moteurs de recherche quelles parties de votre site ils peuvent explorer. Bien rédigé, il préserve votre budget d'exploration et empêche les robots de perdre du temps sur des pages inutiles ; mal rédigé, il peut fermer tout votre site à Google et anéantir votre trafic organique en une nuit. C'est pourquoi ce fichier d'apparence si simple est l'un des points les plus propices aux erreurs en SEO technique.

Que fait réellement robots.txt ?

robots.txt contrôle uniquement le comportement d'exploration (crawling), et non l'indexation. Cette distinction est capitale. Le fichier se trouve à la racine de votre site, à l'adresse https://votresite.com/robots.txt. Avant de demander une URL, un robot lit ce fichier et applique les règles qui le concernent. La norme a été officialisée sous le nom de RFC 9309 (Robots Exclusion Protocol).

L'idée fausse la plus répandue est : « si je bloque une page dans robots.txt, elle disparaîtra de Google ». Non. robots.txt n'empêche pas l'indexation ; il empêche seulement la lecture du contenu. Une page bloquée à l'exploration mais liée depuis d'autres sites peut toujours apparaître dans les résultats avec la mention « Aucune information disponible pour cette page ». Pour retirer entièrement une page des résultats, utilisez une balise meta noindex ou un en-tête HTTP — et ne bloquez pas cette page dans robots.txt, car le robot doit pouvoir explorer la page pour voir la directive noindex.

Structure de base et directives

Le fichier est en texte brut (UTF-8) et se lit par groupes. Chaque groupe commence par une ligne User-agent :

User-agent: *
Disallow: /admin/
Disallow: /panier/
Allow: /admin/global.css

Sitemap: https://votresite.com/sitemap.xml
  • User-agent : indique à quel robot la règle s'applique. * signifie tous les robots. Pour un robot précis, écrivez par ex. Googlebot.
  • Disallow : interdit l'exploration des URL commençant par le préfixe de chemin donné. Disallow: / ferme tout le site ; un Disallow: vide ne bloque rien.
  • Allow : crée une exception à l'intérieur d'une règle Disallow. Chez Google, la règle correspondante la plus longue (la plus spécifique) l'emporte.
  • Sitemap : déclare l'URL complète de votre plan de site. Elle est indépendante des groupes et peut figurer n'importe où dans le fichier.

Google prend en charge le caractère générique * (n'importe quelle suite de caractères) et $ pour ancrer la fin d'une URL. Par exemple, pour bloquer tous les fichiers PDF :

User-agent: *
Disallow: /*.pdf$

Erreurs courantes et leurs conséquences

Les erreurs dans ce fichier sont silencieuses : le site continue de fonctionner, mais au fil des mois votre trafic s'érode. Les plus fréquentes :

  • Bloquer tout le site par accident. Oublier de retirer la ligne Disallow: / lors du passage de la préproduction à la production est le désastre classique. Si cette ligne est présente sur le site en ligne, Google cesse d'explorer.
  • Bloquer le CSS et le JavaScript. Une règle comme Disallow: /assets/ empêche Google de rendre la page correctement. Google dessine la page comme un navigateur ; sans accès aux styles et scripts, il évalue mal votre compatibilité mobile et votre mise en page.
  • Prendre robots.txt pour un outil d'indexation. Lister ici des ressources sensibles (par ex. /rapport-secret.pdf) revient en fait à les exposer — le fichier est public et offre aux curieux un annuaire de chemins. Pour vraiment restreindre l'accès, utilisez l'authentification ou une protection au niveau du serveur.
  • Négliger la sensibilité à la casse. Les chemins distinguent les majuscules : /Page et /page sont considérés comme différents.
  • Renvoyer une erreur 5xx. Si robots.txt renvoie une erreur serveur, Google peut temporairement l'interpréter comme « tout interdit » et ralentir l'exploration. Une 404, à l'inverse, est traitée comme « tout autorisé ».

Crawl-delay et autres directives mal comprises

La directive Crawl-delay n'est pas prise en charge par Google et est ignorée, même si des moteurs comme Bing et Yandex la respectent. Pour gérer le rythme d'exploration de Googlebot, faites-le via la Search Console ou en améliorant vos temps de réponse serveur. De même, la directive Noindex: a fonctionné officieusement un temps, mais Google a supprimé sa prise en charge en 2019 — elle ne fonctionne plus. La seule méthode correcte pour bloquer l'indexation est une balise <meta name="robots" content="noindex"> au niveau de la page ou un en-tête HTTP X-Robots-Tag.

Tester votre fichier

Validez toujours avant la mise en ligne. Une approche pratique :

  • Le rapport robots.txt dans la Google Search Console montre quelle version du fichier Google voit et s'il contient des erreurs.
  • Vérifiez si une URL précise est bloquée avec l'outil d'inspection d'URL en direct.
  • Après une modification, ouvrez le fichier directement dans le navigateur (/robots.txt) pour confirmer qu'il renvoie bien ce que vous attendez ; un cache ou une redirection sert parfois une ancienne version.

Gardez-le petit et simple. Pour la plupart des sites, un fichier clair de dix lignes est bien plus sûr qu'une structure tentaculaire de cent lignes. Moins d'exceptions, moins de risques d'erreur.

Questions fréquentes

Mon site sera-t-il exploré sans robots.txt ?

Oui. robots.txt n'est pas obligatoire ; en l'absence de fichier, les robots considèrent tout comme explorable. Conserver un fichier même vide reste une bonne habitude pour déclarer votre sitemap et ajouter des règles au besoin.

Puis-je bloquer une page avec robots.txt et noindex à la fois ?

Non, ne combinez pas les deux. Si vous bloquez la page dans robots.txt, le robot ne peut pas entrer et voir la balise noindex, donc la page peut rester indexée. Pour bloquer l'indexation, laissez la page explorable et utilisez uniquement noindex.

Combien de temps une modification met-elle à prendre effet ?

Google met généralement robots.txt en cache pendant environ 24 heures. Si vous avez fait une correction urgente, vous pouvez demander une nouvelle exploration depuis la Search Console ; sinon, la mise à jour est automatique en quelques heures.

Les paramètres d'exploration de votre site vous échappent ? Si vous souhaitez auditer de bout en bout votre robots.txt, votre sitemap et votre indexation et les remettre sur des bases sûres, contactez-moi.

Bu kategorideki tüm yazılar →

Devamı için