01 · Banco de pruebas
Comprobador gratuito de rastreadores de IA
Comprueba si los crawlers de búsqueda e IA pueden obtener, indexar y extraer de forma útil una página pública.
Comprueba una página pública
Introduce la URL exacta. El comprobador obtiene HTML limitado y el robots.txt del origen final sin ejecutar JavaScript.
La URL solo se usa para esta comprobación. No se utiliza ningún LLM, crawler de pago, evasión mediante proxy, cuenta ni contenido autenticado.
Cómo se produce el resultado
Una única descarga limitada de HTML y robots.txt se evalúa con reglas deterministas. La herramienta no inventa una probabilidad de citación.
Comprobar todo el sitio en Site AuditCasi nadie bloquea los sistemas de IA a propósito
Pocas empresas deciden de forma consciente que OpenAI no rastree sus páginas para la búsqueda de ChatGPT. Sin embargo, esa decisión puede tomarse por accidente: un robots.txt copiado de un artículo antiguo, una regla antibots activada en el CDN o una configuración de preproducción publicada. Esto puede limitar cómo se descubren y utilizan los contenidos en la búsqueda de ChatGPT sin que nadie lo haya decidido expresamente.
Ocurre con facilidad porque los proveedores operan varios rastreadores con tareas diferentes y nombres parecidos. GPTBot rastrea contenidos para entrenar modelos. OAI-SearchBot rastrea páginas públicas para la búsqueda de ChatGPT. ChatGPT-User recupera una página solicitada por una persona. Bloquear los tres bajo la etiqueta «bots de IA» implica tomar tres decisiones distintas a la vez, normalmente sin darse cuenta.
Por eso una comprobación de acceso no puede responder útilmente «permitido» o «bloqueado». La respuesta útil es un desglose: quién puede hacer qué, y ¿era esa la intención? Cualquier respuesta más corta reproduce la confusión que causó el problema.
Comprobador de crawlers de IA: qué se comprueba
Un sistema de IA solo puede usar tu página si consigue alcanzarla, leerla y situarla. El comprobador recorre esas tres fases por separado: ¿llega una petición hasta el HTML?, ¿permite la propia página su indexación?, y una vez retirados navegación, banners y scripts, ¿queda texto corrido suficiente para citar una afirmación?
La distinción decisiva es la de los roles de rastreo. OpenAI, Google y Anthropic operan varios bots con finalidades distintas: uno para datos de entrenamiento, otro para el índice de búsqueda y otro para la recuperación en directo cuando alguien pega un enlace en un chat. Bloquear esos tres tiene tres consecuencias completamente distintas, y agruparlos en una sola regla suele dejarte fuera de algo que querías conservar.
La comprobación es deliberadamente estrecha: una recuperación limitada del HTML y el robots.txt del destino final, sin ejecutar JavaScript. Te dice si el acceso está abierto. No te dice si tu contenido merece ser citado: eso no lo decide ninguna prueba de acceso.
Los términos, en breve
- GPTBot
- El rastreador de OpenAI para datos de entrenamiento. Bloquearlo mantiene tus contenidos fuera del entrenamiento de futuros modelos. No te retira de la búsqueda de ChatGPT: de eso se ocupa otro bot.
- OAI-SearchBot
- Rastrea páginas públicas para la búsqueda de ChatGPT. Si lo bloqueas, OpenAI no puede rastrear la página para generar resúmenes y fragmentos. Aun así, podrían aparecer el enlace y el título si la URL se descubre por otra vía. El acceso es un requisito, no una garantía de cita.
- ChatGPT-User
- La recuperación en directo: una persona indica una URL en el chat o el modelo sigue un enlace. Ni entrenamiento ni índice: una petición única en nombre de alguien concreto.
- Google-Extended
- Determina si tus contenidos se usan para Gemini y las respuestas de IA de Google. No afecta a tu posicionamiento en la búsqueda clásica, donde solo interviene Googlebot.
- ClaudeBot / Claude-SearchBot / Claude-User
- El reparto de Anthropic sigue el mismo patrón: entrenamiento, índice de búsqueda, recuperación en directo. También aquí un bloqueo general afecta a las tres finalidades a la vez.
Leer el resultado y actuar
200 OK · indexable
La página responde y ni una etiqueta meta robots ni una cabecera X-Robots prohíben la indexación.
Nada. El acceso está abierto: pasa al examen del contenido.
Permitido para búsqueda
El rastreador de búsqueda de ese proveedor puede recuperar la página. Puede aparecer como fuente en sus respuestas.
Nada. Comprueba solo que valga para todos los proveedores relevantes, no para uno solo.
Bloqueado para entrenamiento
Una decisión deliberada, si se tomó deliberadamente. Tus contenidos quedan fuera del entrenamiento y siguen visibles en la búsqueda.
Actúa solo si el bloqueo es involuntario, por ejemplo heredado de un robots.txt copiado.
Bloqueado para búsqueda
El rastreador de búsqueda no pasa. La página no puede aparecer como fuente en ese sistema de IA, por buena que sea.
Revisa robots.txt en busca de un bloque Disallow demasiado amplio y separa entrenamiento de búsqueda.
Sin texto extraíble
Retirados navegación y elementos recurrentes, queda muy poco texto corrido. Habitual con contenido renderizado solo en el cliente.
Valora renderizado en servidor o HTML estático para las secciones que sostienen el contenido.
Tres errores que vemos constantemente
Bloquear todos los bots de IA en una regla
Un «Disallow: /» bajo un bloque de user-agent agrupado afecta a entrenamiento, índice y recuperación directa a la vez. Quien solo quería frenar el entrenamiento pierde también su visibilidad como fuente.
Confundir robots.txt con noindex
El robots.txt regula el rastreo, no la indexación. Una URL bloqueada puede seguir en el índice sin que se haya leído su contenido. Para retirar una página hace falta un noindex, y para eso hay que permitir la recuperación.
Comprobar solo la página de inicio
Las reglas de acceso suelen variar por ruta. Una portada abierta no dice nada sobre si tus guías, tus páginas de producto o tu blog son accesibles.
Comprobador de crawlers de IA: preguntas frecuentes
¿Bloquear GPTBot perjudica mi posicionamiento en Google?
No. GPTBot es un rastreador de OpenAI y no tiene relación con Googlebot. Tu posicionamiento en la búsqueda de Google no se ve afectado. Del mismo modo, Google-Extended solo regula el uso de tus contenidos por IA, no el posicionamiento clásico.
¿Qué diferencia hay entre GPTBot y OAI-SearchBot?
GPTBot rastrea contenidos para entrenar modelos. OAI-SearchBot rastrea páginas públicas para que puedan tenerse en cuenta en la búsqueda de ChatGPT. Puedes bloquear GPTBot y permitir OAI-SearchBot para separar el entrenamiento del rastreo de búsqueda. Ese acceso no garantiza una cita.
¿Por qué ChatGPT no ve mi página aunque robots.txt la permita?
Causas habituales: el contenido se carga con JavaScript y no está en el HTML servido; una etiqueta meta robots o una cabecera X-Robots prohíbe la indexación; o la página es accesible pero no se elige como fuente más relevante. El acceso es la condición, no la garantía.
¿Hay que permitir los rastreadores de IA?
Es una decisión de negocio, no técnica. Quien busca alcance en las respuestas de IA permite al menos los rastreadores de búsqueda. Quien quiere proteger su obra bloquea los de entrenamiento. Ambas cosas son posibles a la vez: para eso existen user-agents separados.
¿Con qué frecuencia conviene comprobarlo?
Tras cada despliegue que toque robots.txt, reglas de CDN, ajustes del firewall de aplicaciones o el renderizado. En la práctica, la mayoría de bloqueos involuntarios no nacen de una decisión sino de una configuración heredada o de una regla antibots.
Fuentes primarias
Las afirmaciones de esta página proceden de la documentación de los proveedores, no de resúmenes de segunda mano. Cada fuente está enlazada para que puedas leer lo que dice realmente.
Continuar con Contextter
Comprobar una URL es diagnóstico. Comprobar un dominio es control.
Esta comprobación te dice si una página es accesible. La pregunta que viene después suele ser: ¿vale eso para las otras dos mil? ¿Y me enteré cuando cambió?
- Rastrea el dominio completo en lugar de una sola URL y muestra dónde difieren las reglas de acceso por ruta.
- Compara cada ejecución con la anterior: un bloqueo nuevo sale a la luz en vez de pasar meses inadvertido.
- Vincula el hallazgo técnico con las páginas que realmente traen tráfico, en lugar de ponderar todos los errores igual.
No hace falta método de pago. La comprobación gratuita de arriba sigue siendo usable sin cuenta.
Herramientas gratuitas relacionadas
Cómo continúa en Contextter
El comprobador gratuito inspecciona una URL pública. Inicia un Site Audit completo para revisar los mismos bloqueos en todo el sitio.
Continuar en ContextterLista cuando tú lo estés.
Inicia la comprobación en el formulario superior. Los procesos intensivos requieren una breve verificación del navegador y aplican límites estrictos.
Las entradas solo se usan para la comprobación elegida. Las herramientas locales nunca suben textos pegados ni archivos.
No hace falta método de pago. La comprobación gratuita de arriba sigue siendo usable sin cuenta.