Skip to main content
Tous les outils gratuits

02 · Banc d’essai

Vérificateur robots.txt gratuit pour robots IA

Vérifiez quels robots IA et moteurs de recherche sont autorisés ou bloqués par robots.txt, quelles règles s’appliquent et ce qu’elles contrôlent.

Banc d’essaiOutil gratuit

Vérifier un fichier robots.txt public

Saisissez un domaine ou l’URL d’une page. L’outil la ramène à l’origine publique et récupère uniquement /robots.txt.

Prêt. La vérification du navigateur démarre avec l’analyse.

Gratuit, sans compte. Un seul fichier robots.txt est récupéré, sans exploration du site ni appel à un LLM.

Comment le résultat est produit

Le vérificateur analyse robots.txt par user-agent et explique l’usage documenté de chaque crawler sans tout réduire à un score unique d’accès IA.

Vérifier tout le site dans Site Audit

Un robots.txt ressemble à une liste. C’est une procédure de sélection.

Quand on ouvre un robots.txt, on le lit de haut en bas comme un règlement. Un robot fait autre chose: il cherche d’abord le bloc correspondant à son nom et ne lit que celui-là. Tout ce qui se trouve au-dessus et en dessous n’existe pas pour lui.

Cette seule propriété produit l’erreur la plus fréquente du SEO technique. Quelqu’un ajoute un bloc pour GPTBot afin d’empêcher l’entraînement et suppose que les règles générales sous « User-agent: * » continuent de s’appliquer. Elles ne s’appliquent plus. Le répertoire censé être fermé à tous devient, à cet instant, ouvert à GPTBot, non parce que quelqu’un l’a ouvert mais parce qu’un second bloc a remplacé le premier.

Le deuxième classique porte sur l’ordre. Google ne tranche pas selon la règle citée en premier mais selon celle qui décrit le chemin le plus long. Un « Allow: /blog/guides/ » situé plus bas annule un « Disallow: /blog/ » situé en haut. Les deux règles sont correctement écrites; le résultat est rarement celui qui était voulu.

D’où une vérification du résultat plutôt que de la syntaxe: que peut faire ce robot précis avec ce chemin précis? Un fichier syntaxiquement irréprochable peut produire exactement l’inverse de ce qu’il semble énoncer.

Vérificateur robots.txt IA: ce qui est vérifié

Un fichier robots.txt n’est pas un verdict unique sur votre site, mais un ensemble de blocs évalués robot par robot. Le vérificateur lit le fichier comme un robot le lit: il cherche le bloc correspondant à son propre nom et n’applique que celui-là.

C’est là que naît le malentendu le plus courant. Beaucoup s’attendent à ce que les règles sous « User-agent: * » s’appliquent en plus des autres. Il n’en est rien: dès qu’un robot trouve un bloc portant son nom, il ignore entièrement le bloc générique. Une règle générale bien intentionnée peut ainsi rester sans effet pour les robots qu’elle visait.

La vérification établit aussi quelle règle l’emporte lorsque plusieurs correspondent. Google ne tranche pas par ordre d’apparition mais par longueur: le chemin correspondant le plus long l’emporte, et à longueur égale « Allow » prime sur « Disallow ». Une règle située plus bas peut donc annuler une règle placée plus haut.

Les termes, en bref

User-agent
Ouvre un bloc de règles pour un robot donné. Un robot n’utilise que le bloc correspondant le plus précisément à son nom: tous les autres n’existent pas pour lui.
Disallow
Interdit la récupération des chemins commençant par ce préfixe. Une valeur vide signifie l’inverse: tout est autorisé.
Allow
Crée une exception à un Disallow plus large. Nécessaire lorsqu’un répertoire entier est bloqué mais que certains fichiers doivent rester accessibles.
Spécificité
Quand plusieurs règles correspondent, celle dont le motif de chemin est le plus long l’emporte, et non celle citée en premier. À longueur égale, Allow prime sur Disallow.
Crawl-delay
Un délai entre deux récupérations. Google ignore totalement cette directive et les autres robots l’interprètent différemment, ce qui la rend peu fiable comme moyen de contrôle.

Lire le constat et agir

Autorisé pour la recherche

Le robot de recherche de ce fournisseur ne trouve aucun bloc l’excluant et peut récupérer le chemin vérifié.

Rien.

Bloqué pour les autres systèmes d’IA

Un robot d’entraînement est bloqué alors que le robot de recherche du même fournisseur ne l’est pas. Séparation valide et souvent voulue.

Vérifiez seulement que cette séparation était intentionnelle et non héritée d’un modèle.

Non couvert par le bloc générique

Un bloc propre à ce robot existe: les règles sous User-agent: * ne s’appliquent donc pas à lui.

Répétez la règle voulue dans le bloc propre au robot. Il n’y a pas d’héritage ici.

Aucun robots.txt trouvé

Le serveur ne renvoie rien d’exploitable. Sans robots.txt, tout est considéré comme autorisé.

N’intervenez que si vous vouliez réellement restreindre certaines zones.

Trois erreurs que nous voyons sans cesse

  • Compter sur l’héritage du bloc générique

    Dès qu’un robot trouve un bloc à son nom, seul ce bloc s’applique. Les règles sous « User-agent: * » deviennent inertes pour lui: chaque restriction encore souhaitée doit y être répétée.

  • Croire que l’ordre prime sur la longueur

    Une règle placée plus haut ne l’emporte pas automatiquement. Google retient le motif de chemin le plus long. Un « Allow: /blog/guides/ » plus bas annule un « Disallow: /blog/ » plus haut, souvent involontairement.

  • Bloquer pour retirer une page de l’index

    Une URL bloquée par robots.txt peut rester indexée, car Google la connaît par les liens et n’a simplement pas le droit de la lire. Le retrait exige un noindex, donc une récupération autorisée.

Vérificateur robots.txt IA: questions fréquentes

« User-agent: * » s’applique-t-il en plus de mon bloc spécifique?

Non. Un robot choisit exactement un bloc, celui qui correspond le plus précisément à son nom, et ignore tous les autres. Si vous créez un bloc pour GPTBot, les règles sous * ne s’appliquent plus à lui. Tout ce qui doit rester valable doit y être répété.

Le robots.txt suffit-il à retirer une page de Google?

Non, et c’est l’un des malentendus les plus coûteux en SEO technique. Le fichier empêche l’exploration, pas l’indexation. Google peut continuer à lister une URL bloquée si des liens y mènent, alors sans description. Pour la retirer, posez un noindex et autorisez la récupération afin que Google puisse le voir.

Comment bloquer l’entraînement IA sans perdre en visibilité?

Bloquez les robots d’entraînement et autorisez ceux de recherche. Chez OpenAI: bloquer GPTBot, autoriser OAI-SearchBot. Chez Anthropic: bloquer ClaudeBot, autoriser Claude-SearchBot. Chez Google, Google-Extended régit l’usage IA tandis que Googlebot continue de servir la recherche.

Que se passe-t-il en cas d’erreur de syntaxe?

Les robots ignorent les lignes qu’ils ne comprennent pas et évaluent le reste. C’est plus dangereux qu’une erreur franche: une directive mal orthographiée ne se signale pas, elle reste simplement sans effet. D’où une vérification du résultat réel par robot, et pas seulement de la syntaxe.

Crawl-delay a-t-il sa place dans un robots.txt moderne?

Pas pour Google, qui ignore la directive. Les autres robots la traitent de façon inégale. Si la charge serveur est le vrai problème, une limitation de débit côté serveur ou CDN et un sitemap propre sont des moyens plus fiables.

Sources primaires

Les affirmations de cette page proviennent de la documentation des fournisseurs, non de résumés de seconde main. Chaque source est liée pour que vous puissiez lire ce qui y figure réellement.

Continuer avec Contextter

Les règles changent sans que personne ne les change

La plupart des problèmes de robots.txt naissent non pas à l’écriture du fichier mais après: lors d’une refonte, d’une migration CDN, d’une mise à jour d’extension.

  • Réévalue les règles d’accès à chaque passage et signale tout changement de résultat pour un robot.
  • Montre l’effet sur des URL réellement existantes au lieu de se limiter à valider le fichier.
  • Associe les blocages d’exploration aux pages concernées pour montrer ce que l’erreur coûte réellement.

Aucun moyen de paiement requis. La vérification gratuite ci-dessus reste utilisable sans compte.

Outils gratuits associés

La suite dans Contextter

Utilisez Site Audit pour vérifier à grande échelle si robots.txt, le CDN ou l’application bloquent des pages importantes.

Continuer dans Contextter

Prêt quand vous l’êtes.

Lancez la vérification dans le formulaire ci-dessus. Les traitements intensifs demandent une courte vérification du navigateur et appliquent des limites strictes.

Les entrées servent uniquement à la vérification choisie. Les outils locaux n’envoient jamais les textes collés ni les fichiers.

Aucun moyen de paiement requis. La vérification gratuite ci-dessus reste utilisable sans compte.