Skip to main content
Tous les outils gratuits

01 · Banc d’essai

Vérificateur gratuit de robots d’indexation IA

Vérifiez si les crawlers de recherche et d’IA peuvent récupérer, indexer et extraire utilement une page publique.

Banc d’essaiOutil gratuit

Vérifier une page publique

Saisissez l’URL exacte. Le vérificateur récupère un HTML limité et le fichier robots.txt de l’origine finale sans exécuter JavaScript.

La vérification du navigateur ne commence qu’après l’envoi de l’URL.

L’URL sert uniquement à cette vérification. Aucun LLM, crawler payant, contournement par proxy, compte ou contenu authentifié n’est utilisé.

Comment le résultat est produit

Une seule récupération limitée du HTML et du fichier robots.txt est évaluée avec des règles déterministes. L’outil n’invente pas de probabilité de citation.

Vérifier tout le site dans Site Audit

Presque personne ne bloque les systèmes d’IA volontairement

Peu d’entreprises décident délibérément qu’OpenAI ne doit pas explorer leurs pages pour la recherche ChatGPT. Pourtant, ce choix se fait souvent par accident: un robots.txt repris d’un ancien article, une protection anti-robots activée sur le CDN ou une configuration de préproduction déployée en ligne. Cela peut limiter la découverte et l’utilisation des contenus dans la recherche ChatGPT sans décision consciente.

Cela arrive facilement parce que les fournisseurs exploitent plusieurs robots aux missions différentes mais aux noms proches. GPTBot explore des contenus pour l’entraînement des modèles. OAI-SearchBot explore les pages publiques pour la recherche ChatGPT. ChatGPT-User récupère une page demandée par une personne. Bloquer les trois sous l’étiquette « robots d’IA » revient à prendre trois décisions distinctes à la fois, souvent sans s’en apercevoir.

C’est aussi pourquoi une vérification d’accès ne peut pas se contenter de répondre « autorisé » ou « bloqué ». La réponse utile est une ventilation: qui a le droit de faire quoi, et était-ce l’intention? Toute réponse plus courte reproduit la confusion qui a créé le problème.

Vérificateur de crawlers IA: ce qui est vérifié

Un système d’IA ne peut utiliser votre page que s’il parvient à l’atteindre, à la lire et à la situer. Le vérificateur traite ces trois étapes séparément: une requête arrive-t-elle jusqu’au HTML, la page autorise-t-elle son indexation, et une fois la navigation, les bannières et les scripts retirés, reste-t-il assez de texte suivi pour en citer une affirmation?

La distinction décisive porte sur les rôles des robots. OpenAI, Google et Anthropic exploitent chacun plusieurs robots aux finalités différentes: un pour les données d’entraînement, un pour l’index de recherche, un pour la récupération en direct lorsqu’un utilisateur transmet un lien. Bloquer ces trois-là produit trois conséquences très différentes, et les réunir dans une seule règle revient presque toujours à s’exclure de quelque chose que l’on voulait conserver.

La vérification reste volontairement étroite: une récupération HTML limitée et le fichier robots.txt de la destination finale, sans exécuter JavaScript. Elle indique si l’accès est ouvert. Elle ne dit pas si votre contenu mérite d’être cité: aucun test d’accès ne tranche cette question.

Les termes, en bref

GPTBot
Le robot d’OpenAI dédié aux données d’entraînement. Le bloquer empêche vos contenus d’alimenter les futurs modèles. Cela ne vous retire pas de la recherche ChatGPT: un autre robot s’en charge.
OAI-SearchBot
Explore les pages publiques pour la recherche ChatGPT. Le bloquer empêche OpenAI d’explorer la page pour les résumés et extraits. Un lien et le titre de la page peuvent toutefois apparaître si l’URL est découverte autrement. L’accès est une condition préalable, pas une garantie de citation.
ChatGPT-User
La récupération en direct: un utilisateur indique une URL dans la conversation ou le modèle suit un lien. Ni entraînement, ni indexation: une requête unique pour une personne précise.
Google-Extended
Détermine si vos contenus servent à Gemini et aux réponses IA de Google. Sans effet sur votre classement dans la recherche Google classique, où Googlebot reste seul concerné.
ClaudeBot / Claude-SearchBot / Claude-User
La répartition d’Anthropic suit le même schéma: entraînement, index de recherche, récupération en direct. Là encore, un blocage global touche les trois finalités à la fois.

Lire le constat et agir

200 OK · indexable

La page répond, et ni une balise meta robots ni un en-tête X-Robots n’interdit l’indexation.

Rien. L’accès est ouvert: passez à l’examen du contenu.

Autorisé pour la recherche

Le robot de recherche de ce fournisseur peut récupérer la page. Elle peut apparaître comme source dans ses réponses.

Rien. Vérifiez seulement que cela vaut pour tous les fournisseurs qui comptent, pas pour un seul.

Bloqué pour l’entraînement

Un choix délibéré, s’il a été fait délibérément. Vos contenus restent hors entraînement tout en demeurant visibles dans la recherche.

N’intervenez que si le blocage est involontaire, par exemple hérité d’un robots.txt copié.

Bloqué pour la recherche

Le robot de recherche ne passe pas. La page ne peut pas apparaître comme source dans ce système d’IA, quelle que soit sa qualité.

Cherchez un bloc Disallow trop large dans robots.txt et séparez l’entraînement de la recherche.

Aucun texte extractible

Une fois la navigation et les éléments récurrents retirés, il reste trop peu de texte suivi. Fréquent avec un rendu entièrement côté client.

Envisagez un rendu côté serveur ou du HTML statique pour les sections porteuses de contenu.

Trois erreurs que nous voyons sans cesse

  • Bloquer tous les robots d’IA en une règle

    Un « Disallow: / » sous un bloc user-agent regroupé touche à la fois l’entraînement, l’index et la récupération directe. Qui voulait seulement empêcher l’entraînement perd aussi sa visibilité comme source.

  • Confondre robots.txt et noindex

    Le fichier robots.txt régit l’exploration, pas l’indexation. Une URL bloquée peut rester dans l’index, sans que son contenu ait été lu. Pour retirer une page, il faut un noindex et donc autoriser la récupération.

  • Ne vérifier que la page d’accueil

    Les règles d’accès varient souvent selon le chemin. Une page d’accueil ouverte ne dit rien de l’accessibilité de vos guides, de vos pages produit ou de votre blog.

Vérificateur de crawlers IA: questions fréquentes

Bloquer GPTBot nuit-il à mon classement Google?

Non. GPTBot est un robot d’OpenAI, sans rapport avec Googlebot. Votre classement dans la recherche Google reste inchangé. De même, Google-Extended ne régit que l’usage IA de vos contenus, pas le classement classique.

Quelle différence entre GPTBot et OAI-SearchBot?

GPTBot explore des contenus pour l’entraînement des modèles. OAI-SearchBot explore les pages publiques afin qu’elles puissent être prises en compte dans la recherche ChatGPT. Vous pouvez bloquer GPTBot tout en autorisant OAI-SearchBot pour séparer entraînement et exploration de recherche. Cet accès ne garantit pas une citation.

Pourquoi ChatGPT ne voit-il pas ma page alors que robots.txt l’autorise?

Causes fréquentes: le contenu est chargé en JavaScript et absent du HTML servi; une balise meta robots ou un en-tête X-Robots interdit l’indexation; ou la page est accessible mais n’est pas retenue comme source la plus pertinente. L’accès est la condition, pas la garantie.

Faut-il autoriser les robots d’IA?

C’est une décision commerciale, pas technique. Qui vise la visibilité dans les réponses IA autorise au moins les robots de recherche. Qui veut protéger ses contenus bloque les robots d’entraînement. Les deux sont possibles simultanément: c’est précisément pourquoi les user-agents sont distincts.

À quelle fréquence vérifier?

Après chaque déploiement touchant robots.txt, les règles CDN, le pare-feu applicatif ou le rendu. En pratique, la plupart des blocages involontaires ne viennent pas d’une décision mais d’une configuration héritée ou d’une règle anti-robots.

Sources primaires

Les affirmations de cette page proviennent de la documentation des fournisseurs, non de résumés de seconde main. Chaque source est liée pour que vous puissiez lire ce qui y figure réellement.

Continuer avec Contextter

Vérifier une URL relève du diagnostic. Vérifier un domaine relève du contrôle.

Cette vérification indique si une page est accessible. La question suivante est généralement: cela vaut-il pour les deux mille autres? Et le savais-je au moment du changement?

  • Explore le domaine entier au lieu d’une seule URL et montre où les règles d’accès diffèrent selon le chemin.
  • Compare chaque passage au précédent: un nouveau blocage ressort au lieu de passer inaperçu pendant des mois.
  • Relie le constat technique aux pages qui portent réellement du trafic, plutôt que de pondérer chaque erreur également.

Aucun moyen de paiement requis. La vérification gratuite ci-dessus reste utilisable sans compte.

Outils gratuits associés

La suite dans Contextter

Le vérificateur gratuit inspecte une seule URL publique. Lancez un Site Audit complet pour vérifier les mêmes blocages sur l’ensemble du site.

Continuer dans Contextter

Prêt quand vous l’êtes.

Lancez la vérification dans le formulaire ci-dessus. Les traitements intensifs demandent une courte vérification du navigateur et appliquent des limites strictes.

Les entrées servent uniquement à la vérification choisie. Les outils locaux n’envoient jamais les textes collés ni les fichiers.

Aucun moyen de paiement requis. La vérification gratuite ci-dessus reste utilisable sans compte.