Robots.txt sur WordPress : Comment le configurer et éviter des erreurs critiques pour votre SEO

Un fichier robots.txt mal configuré peut faire disparaître des pans entiers de votre site des résultats de recherche, sans qu’aucune erreur ne s’affiche nulle part. C’est l’un des fichiers les plus petits de votre installation WordPress, et pourtant l’un de ceux que je vérifie systématiquement en premier lors d’un audit technique. Une ligne « Disallow: / » oubliée après une mise en production, et c’est tout le site qui devient invisible pour Google.

Qu’est-ce que le fichier robots.txt sur WordPress et comment fonctionne-t-il ?

Le robots.txt est un fichier texte placé à la racine de votre site (accessible à l’adresse votredomaine.fr/robots.txt) qui donne des instructions aux robots des moteurs de recherche sur les zones qu’ils peuvent explorer et celles qu’ils doivent éviter. Ce n’est pas une mesure de sécurité : le fichier est public, et n’importe qui peut le consulter. Il s’agit uniquement d’une directive de crawl, que les robots bien élevés (Googlebot, Bingbot) respectent, mais qu’un robot malveillant peut parfaitement ignorer.

Particularité de WordPress : si vous n’avez jamais créé de robots.txt manuellement, WordPress en génère un virtuellement à la volée. Il n’existe pas physiquement sur votre serveur, mais il répond quand même quand un robot le demande. Ce fichier par défaut est minimaliste, il bloque généralement l’accès à /wp-admin/ tout en autorisant /wp-admin/admin-ajax.php (nécessaire au bon fonctionnement de nombreux plugins et thèmes).

Dès que vous installez un plugin SEO (Rank Math, Yoast, All in One SEO) ou que vous déposez un fichier robots.txt physique à la racine via FTP, ce fichier virtuel est remplacé par votre propre version. C’est là que les choses peuvent se compliquer si vous ne savez pas exactement ce que vous écrivez.

Faut-il vraiment configurer son robots.txt sur WordPress ?

Sur un site qui démarre, avec une dizaine de pages, le robots.txt par défaut de WordPress suffit largement. L’impact d’une configuration plus poussée sera quasiment invisible.

La question devient pertinente quand votre site grossit : blog actif, fiches produits en nombre sur WooCommerce, pages de filtres, archives multiples. Google alloue à chaque site ce qu’il appelle un « budget de crawl », c’est-à-dire un nombre de pages qu’il est prêt à explorer sur une période donnée. Sur un petit site, ce budget n’est jamais un facteur limitant. Sur un site avec plusieurs milliers d’URLs, en revanche, chaque page inutile explorée (résultats de recherche interne, pages de pagination profonde, versions filtrées d’un même catalogue) est une page utile en moins explorée à la place.

C’est à ce moment-là qu’un robots.txt pensé stratégiquement, en complément d’un sitemap XML propre, fait une vraie différence sur la vitesse à laquelle vos nouveaux contenus sont découverts et indexés.

À quoi ressemble un robots.txt WordPress bien configuré ?

Voici la base que je pose sur la grande majorité des sites WordPress que j’audite :

User-agent: *
Allow: /wp-admin/admin-ajax.php
Disallow: /wp-admin/
Disallow: /wp-content/plugins/
Disallow: /?s=
Disallow: /*?add-to-cart=

Sitemap: https://votredomaine.fr/sitemap_index.xml
Fichier robots.txt WordPress ouvert dans un navigateur, montrant les règles Allow et Disallow ainsi que la ligne Sitemap

Configuration simple pour un site vitrine ou un blog

Sur un site sans catalogue produit, ces quelques lignes suffisent : on bloque l’admin, on bloque les résultats de recherche interne (qui génèrent des pages à contenu quasi vide et souvent dupliqué), et on indique la localisation du sitemap XML pour aider les robots à découvrir vos pages plus vite.

Configuration pour un site avec beaucoup de contenu ou du e-commerce

Sur un site WooCommerce, j’ajoute généralement des règles pour éviter que les robots n’explorent les URLs générées par les filtres et le panier (add-to-cart, paramètres de tri, pages de pagination très profondes), qui multiplient les variantes d’une même page produit sans apporter de valeur de crawl. L’objectif n’est pas de bloquer un maximum de choses, mais de rediriger le budget de crawl vers les pages qui comptent réellement pour votre business.

Un point que je vois trop souvent mal compris : le robots.txt ne doit jamais servir à masquer des pages déjà indexées. Une page bloquée après coup peut continuer à apparaître dans les résultats (sans description, juste avec l’URL) si elle est encore liée depuis ailleurs. Pour retirer une page de l’index, l’outil adapté est la balise noindex, pas le robots.txt.

Pourquoi cette ligne Allow: /wp-admin/admin-ajax.php ? Ce fichier est celui que WordPress utilise en interne pour gérer les requêtes AJAX, c’est-à-dire les échanges de données en arrière-plan sans recharger la page (formulaires de recherche instantanée, filtres de produits WooCommerce, compteurs de commentaires, certains carrousels). Beaucoup de thèmes et de plugins s’appuient dessus pour fonctionner correctement côté visiteur, pas seulement côté admin. Comme il est situé dans /wp-admin/, un Disallow: /wp-admin/ généraliste le bloquerait aussi par défaut. Or si Googlebot ne peut pas atteindre ce fichier au moment de rendre la page pour comprendre son affichage complet, certains éléments dynamiques peuvent ne pas s’afficher correctement dans l’évaluation qu’il fait de la page. Cette ligne crée donc une exception ciblée dans le blocage général.

Les configurations de robots.txt qui font perdre du trafic sur WordPress

Sur les audits que je mène, ce sont toujours les mêmes erreurs qui reviennent, et elles sont souvent invisibles tant que personne ne va vérifier le fichier :

  • Le site entier bloqué après une mise en production. Le classique : le site a été construit en environnement de test avec l’option « Décourager les moteurs de recherche d’indexer ce site » activée dans WordPress, et personne ne la désactive au moment de la mise en ligne. Résultat : Disallow: / s’applique à tout le domaine, et le site sort progressivement de l’index Google sans qu’aucune alerte visible ne prévienne le propriétaire.
  • Le blocage des dossiers CSS et JS. Certaines vieilles configurations bloquent /wp-content/ en entier, y compris les fichiers de style et de script des thèmes. Google a besoin de charger ces ressources pour comprendre comment votre page s’affiche réellement, rendu mobile compris. Un site qui bloque ses propres CSS/JS peut être mal interprété au moment du rendu, avec un impact direct sur son évaluation de qualité.
  • La confusion entre robots.txt et indexation. Bloquer une URL au crawl ne la retire pas de l’index si elle y est déjà. Pour bien comprendre comment WordPress gère réellement le passage d’une page de « crawlable » à « indexée », j’ai détaillé le sujet dans mon article sur l’indexation wordpress.
  • L’oubli de mise à jour après une refonte. Changement de structure d’URLs, migration de plugin SEO, changement de plateforme : le robots.txt hérite souvent de règles obsolètes qui pointent vers des chemins qui n’existent plus, ou qui bloquent de nouvelles sections du site sans le vouloir.
  • Bloquer les catégories, tags et pages d’archives par principe. C’est une idée reçue que j’entends encore régulièrement : certains pensent qu’en bloquant ces pages, ils « économisent » du budget de crawl et améliorent leur référencement. C’est l’inverse. Ces pages d’archives aident Google à comprendre la structure de votre site et à découvrir vos contenus via le maillage interne qu’elles proposent. Les bloquer sans raison précise (contenu dupliqué avéré, page vide) prive Google d’un signal de structure utile, sans bénéfice réel en échange.

Comment créer ou modifier le robots.txt sur WordPress ?

Plusieurs méthodes permettent de créer ou modifier un robots.txt sur WordPress. Je détaille chacune pas à pas ci-dessous.

Méthode 1 : via Rank Math

C’est le plugin que j’installe le plus souvent chez mes clients, et son éditeur de robots.txt est intégré directement dans les réglages.

  • Dans votre tableau de bord WordPress, allez dans Rank Math puis Réglages généraux.
  • Cliquez sur l’onglet Éditer robots.txt.
  • Activez le bouton Modifier robots.txt si ce n’est pas déjà fait.
  • Collez vos règles dans le champ texte, en remplaçant le contenu par défaut si besoin.
  • Cliquez sur Enregistrer les modifications.
  • Vérifiez immédiatement le résultat en ouvrant votredomaine.fr/robots.txt dans un nouvel onglet.
Onglet Modifier le robots.txt dans Rank Math, Réglages généraux, avec le champ texte des règles visible

Méthode 2 : via Yoast SEO

  • Allez dans SEO puis Outils dans le menu WordPress.
  • Cliquez sur Éditeur de fichiers.
  • Si aucun robots.txt n’existe encore, Yoast propose un bouton Créer un fichier robots.txt.
  • Modifiez le contenu directement dans l’éditeur qui s’affiche.
  • Cliquez sur Enregistrer les modifications apportées à robots.txt.

Si cet onglet Éditeur de fichiers n’apparaît pas, c’est généralement que l’édition de fichiers est désactivée au niveau de l’hébergement. Dans ce cas, la méthode FTP décrite plus bas reste toujours disponible.

Méthode 3 : via All in One SEO (AIOSEO)

  • Allez dans All in One SEO puis Outils.
  • Activez le bouton Activer robots.txt personnalisé.
  • Renseignez vos règles via l’interface (champ User-agent, choix Allow ou Disallow, chemin du répertoire), ou collez-les directement selon la version du plugin.
  • Cliquez sur Enregistrer les modifications.

Méthode 4 : manuellement, via FTP ou le gestionnaire de fichiers de l’hébergeur

Cette méthode s’adresse à ceux qui sont à l’aise techniquement ou qui n’ont pas de plugin SEO installé.

  • Connectez-vous à votre site via un client FTP comme FileZilla, ou via le gestionnaire de fichiers fourni par votre hébergeur.
  • Repérez la racine de votre site : c’est le dossier qui contient wp-admin, wp-content, wp-includes et le fichier wp-config.php.
  • Si un fichier robots.txt existe déjà à cet endroit, téléchargez-en une copie sur votre ordinateur avant toute modification, pour pouvoir revenir en arrière en cas d’erreur.
  • Ouvrez un éditeur de texte brut comme Notepad, TextEdit, ou l’éditeur intégré de votre gestionnaire de fichiers, et rédigez vos règles.
  • Enregistrez le fichier sous le nom exact robots.txt, en minuscules.
  • Envoyez-le à la racine de votre site, en remplaçant l’ancien fichier s’il y en avait un.
  • Vérifiez le résultat en ouvrant votredomaine.fr/robots.txt dans votre navigateur.
Fichier robots.txt à la racine du site dans un client FTP, au même niveau que les dossiers wp-admin, wp-content et wp-includes

Dans les quatre cas, la vérification finale est la même : ouvrir l’URL du fichier dans un navigateur pour confirmer que les règles enregistrées sont bien celles que vous vouliez, avant de passer au test dans Google Search Console.

Faut-il bloquer les robots des IA dans son robots.txt WordPress ?

C’est un point que la plupart des guides sur le sujet ne couvrent pas encore, et que je vois de plus en plus revenir dans mes échanges avec des clients depuis que ChatGPT, Perplexity et les autres moteurs génératifs sont devenus des sources de trafic à part entière.

Au-delà de Googlebot et Bingbot, il existe désormais des robots dédiés à l’entraînement ou à l’alimentation en temps réel des modèles d’IA : GPTBot (OpenAI), Google-Extended (Gemini, distinct de Googlebot classique), PerplexityBot, ClaudeBot, entre autres. Chacun peut être autorisé ou bloqué indépendamment dans votre robots.txt, avec sa propre ligne User-agent.

User-agent: GPTBot
Disallow: /

User-agent: PerplexityBot
Allow: /

La décision dépend entièrement de votre stratégie. Si vous cherchez à être cité dans les réponses de ChatGPT ou Perplexity (ce qu’on appelle le GEO, pour Generative Engine Optimization), vous avez tout intérêt à laisser ces robots accéder à votre contenu. Si à l’inverse votre modèle économique repose sur du trafic direct que vous ne voulez pas voir repris sans contrepartie par ces plateformes, bloquer ces user-agents est une option légitime. Il n’y a pas de bonne réponse universelle ici, c’est un arbitrage business à faire au cas par cas.

Quelques repères chiffrés pour situer l’ampleur du phénomène. Sur le nombre de sites qui bloquent GPTBot, les études ne convergent pas exactement, mais la tendance de fond est nette : une analyse d’Originality.AI portant sur le top 1000 mondial situait le taux de blocage à 35 % en 2025, avec un chiffre plus élevé en Europe autour de 42 % (source : Originality.AI, 2025, relayé par AISOS). Une autre analyse sur le même périmètre avance un taux de 25 %, contre seulement 5 % début 2023 (source : xSeek, 2026). Ces écarts tiennent surtout à la méthodologie et à la date de mesure, mais dans les deux cas la progression est rapide et continue.

Côté volumes de crawl, Cloudflare a mesuré une progression du trafic vérifié de GPTBot de 4,7 % en juillet 2024 à 11,7 % en juillet 2025, soit une activité de crawl en hausse d’environ 305 % sur un an (source : Cloudflare, analyse août 2025). Sur les règles robots.txt elles-mêmes, GPTBot reste le crawler IA le plus fréquemment bloqué, présent dans 5,52 % des règles Disallow analysées au premier trimestre 2026, devant CCBot, ClaudeBot et Google-Extended (source : Cloudflare Radar via TechnologyChecker.io, Q1 2026).

Un cas concret illustre bien le risque d’un blocage involontaire : un site média français a activé une option de blocage global des bots IA sur Cloudflare en janvier 2026 sans s’en rendre compte. Résultat, ses citations dans Perplexity et ChatGPT sont tombées à zéro pendant six semaines, alors qu’il était habituellement cité entre 30 et 40 fois par mois. Après correction du robots.txt et de la configuration Cloudflare, les citations sont remontées à une moyenne de 47 par semaine (source : AEO Tool, avril 2026). C’est exactement le type d’incident que je recherche en priorité quand un client me signale une baisse soudaine de visibilité dans les IA génératives : la cause est souvent une couche technique (CDN, plugin de sécurité) qui bloque en plus du robots.txt lui-même, et qu’il faut vérifier séparément.

Comment tester son robots.txt WordPress dans Google Search Console ?

Une fois votre fichier en place, ne partez pas du principe qu’il fonctionne comme prévu sans le vérifier. Google Search Console propose un rapport dédié, accessible depuis Paramètres puis Exploration puis robots.txt. Ce rapport affiche la dernière version du fichier que Google a récupérée, la date de sa dernière lecture, et signale les éventuelles erreurs de syntaxe ou incohérences logiques.

Rapport robots.txt dans Google Search Console, Paramètres puis Exploration, montrant la dernière version détectée et son statut

Google revérifie votre robots.txt environ une fois par jour. Si vous venez de le modifier, ne vous inquiétez pas si le changement n’apparaît pas immédiatement dans le rapport : revenez le lendemain pour confirmer que la nouvelle version a bien été prise en compte.

Je recommande de refaire ce contrôle systématiquement après tout changement structurel du site : migration, changement de plugin SEO, modification de la structure des permaliens, ou passage d’un environnement de recette à la production. C’est précisément dans ces moments de transition que les blocages accidentels apparaissent.

Le robots.txt WordPress dans une stratégie SEO technique globale

Le robots.txt ne fonctionne jamais isolément. Il s’inscrit dans un ensemble de fichiers et de réglages techniques qui, ensemble, déterminent comment Google découvre, explore et indexe votre site. Le vérifier sans regarder le reste donne une vision partielle du problème.

Concrètement, il s’articule avec :

  • Le sitemap XML, dont l’URL est justement référencée dans le robots.txt, et qui liste les pages que vous souhaitez voir explorées en priorité. J’explique comment le configurer correctement dans mon article sur le sitemap xml et wordpress.
  • Les redirections, qui évitent que le crawl ne se perde sur des URLs mortes ou dupliquées après une refonte, un changement de structure ou une suppression de contenu. J’ai détaillé la méthode dans mon guide sur la redirection wordpress.
  • L’indexation, l’étape suivante du crawl, qui détermine si une page explorée finit réellement dans l’index de Google.

C’est pour cette raison que je traite systématiquement le robots.txt comme une étape d’un audit seo wordpress plus large, et jamais comme un réglage isolé qu’on configure une fois pour toutes et qu’on oublie. Un fichier robots.txt propre, couplé à un sitemap à jour et des redirections bien gérées, c’est la base technique qui permet à tout le reste de votre travail de contenu de porter ses fruits.

FAQ robots.txt WordPress

À quoi sert le fichier robots.txt sur WordPress ?

Il indique aux robots des moteurs de recherche et des IA quelles parties de votre site ils peuvent explorer, et lesquelles éviter. Il ne garantit pas qu’une page soit ou non indexée, il contrôle uniquement l’accès au crawl.

Où se trouve le robots.txt d’un site WordPress ?

À la racine du domaine, à l’adresse votredomaine.fr/robots.txt. S’il n’a jamais été créé manuellement, WordPress en génère un virtuellement à cette même adresse.

Le robots.txt peut-il sécuriser une page privée ?

Non. Le fichier est public et consultable par tous, y compris par des robots malveillants qui ne le respectent pas. Pour protéger une page, il faut une authentification ou une restriction serveur, pas une ligne Disallow.

Faut-il bloquer les catégories et tags dans le robots.txt WordPress ?

Non, sauf cas précis de contenu dupliqué avéré. Ces pages aident Google à comprendre la structure du site, les bloquer par principe est contre-productif.

Quelle est la différence entre robots.txt et la balise noindex ?

Le robots.txt empêche le crawl d’une page, la balise noindex empêche son indexation même si elle a été explorée. Une page déjà indexée avant son blocage en robots.txt peut continuer d’apparaître dans les résultats sans description.

Bloquer GPTBot dans le robots.txt empêche-t-il ChatGPT de me citer ?

Oui, un Disallow ciblant GPTBot ou les autres crawlers IA (ClaudeBot, PerplexityBot, Google-Extended) empêche ces modèles d’explorer vos nouvelles pages et donc de vous citer sur ce contenu récent.