Skip to main content
Todas las herramientas gratuitas

02 · Banco de pruebas

Comprobador de robots.txt gratuito para IA

Comprueba qué rastreadores de IA y buscadores permite o bloquea robots.txt, qué reglas se aplican y qué controla cada directiva.

Banco de pruebasHerramienta gratuita

Comprobar un robots.txt público

Introduce un dominio o la URL de una página. La herramienta la normaliza al origen público y recupera únicamente /robots.txt.

Listo. La verificación del navegador comienza al ejecutar la comprobación.

Gratis y sin cuenta. Se recupera un solo robots.txt, sin rastrear el sitio ni llamar a un LLM.

Cómo se produce el resultado

El comprobador analiza robots.txt por user-agent y explica el propósito documentado de cada crawler sin reducirlos a una sola puntuación de acceso de IA.

Comprobar todo el sitio en Site Audit

Un robots.txt parece una lista. Es un procedimiento de selección.

Cuando abres un robots.txt lo lees de arriba abajo como un reglamento. Un rastreador hace otra cosa: busca primero el bloque que corresponde a su nombre y lee solo ese. Todo lo que hay encima y debajo no existe para él.

Esa única propiedad genera el error más común del SEO técnico. Alguien añade un bloque para GPTBot con el fin de frenar el entrenamiento y supone que las reglas generales bajo «User-agent: *» siguen aplicándose. Ya no lo hacen. El directorio que debía estar cerrado para todos queda, desde ese momento, abierto para GPTBot: no porque alguien lo abriera, sino porque un segundo bloque sustituyó al primero.

El segundo clásico tiene que ver con el orden. Google no decide por qué regla aparece primero, sino por cuál describe la ruta más larga. Un «Allow: /blog/guias/» situado más abajo anula un «Disallow: /blog/» situado arriba. Ambas reglas están bien escritas; el resultado rara vez es el pretendido.

Por eso esta herramienta comprueba el resultado y no la sintaxis: ¿qué puede hacer este bot concreto con esta ruta concreta? Un archivo sintácticamente impecable puede lograr justo lo contrario de lo que parece decir.

Comprobador de robots.txt para IA: qué se comprueba

Un robots.txt no es un veredicto único sobre tu sitio, sino un conjunto de bloques que se evalúa rastreador por rastreador. El comprobador lee el archivo como lo lee un bot: busca el bloque que corresponde a su propio nombre y aplica solo ese.

Ahí nace el malentendido más común. Muchos esperan que las reglas bajo «User-agent: *» se apliquen además de las demás. No es así: en cuanto un rastreador encuentra un bloque con su nombre, ignora por completo el bloque comodín. Una regla general bien intencionada puede quedar así sin efecto precisamente para los bots a los que iba dirigida.

La comprobación determina además qué regla gana cuando coinciden varias. Google no decide por orden sino por longitud: gana la ruta coincidente más larga y, a igual longitud, «Allow» prevalece sobre «Disallow». Una regla situada más abajo puede anular otra situada más arriba.

Los términos, en breve

User-agent
Abre un bloque de reglas para un rastreador concreto. Un bot usa solo el bloque que coincide con mayor precisión con su nombre: los demás no existen para él.
Disallow
Prohíbe recuperar rutas que empiecen por ese prefijo. Un valor vacío significa lo contrario: todo permitido.
Allow
Crea una excepción a un Disallow más amplio. Necesario cuando se bloquea un directorio entero pero ciertos archivos deben seguir accesibles.
Especificidad
Cuando coinciden varias reglas gana la del patrón de ruta más largo, no la citada primero. A igual longitud, Allow prevalece sobre Disallow.
Crawl-delay
Una espera entre recuperaciones. Google ignora la directiva por completo y otros rastreadores la interpretan de forma dispar, lo que la hace poco fiable como control.

Leer el resultado y actuar

Permitido para búsqueda

El rastreador de búsqueda de ese proveedor no encuentra ningún bloque que lo excluya y puede recuperar la ruta comprobada.

Nada.

Bloqueado para otros sistemas de IA

Un rastreador de entrenamiento está bloqueado mientras el de búsqueda del mismo proveedor no lo está. Separación válida y a menudo intencionada.

Comprueba solo que la separación fuese intencionada y no heredada de una plantilla.

No cubierto por el bloque comodín

Existe un bloque propio para este bot, así que las reglas bajo User-agent: * no le afectan.

Repite la regla deseada dentro del bloque propio del bot. Aquí no hay herencia.

No se encontró robots.txt

El servidor no devuelve nada utilizable. Sin robots.txt todo se considera permitido.

Actúa solo si realmente querías restringir ciertas zonas.

Tres errores que vemos constantemente

  • Confiar en la herencia del bloque comodín

    En cuanto un rastreador encuentra un bloque con su nombre, solo ese bloque se le aplica. Las reglas bajo «User-agent: *» quedan inertes para él: toda restricción que siga siendo necesaria debe repetirse allí.

  • Suponer que el orden manda sobre la longitud

    Una regla situada más arriba no gana automáticamente. Google evalúa el patrón de ruta más largo. Un «Allow: /blog/guias/» más abajo anula un «Disallow: /blog/» más arriba, a menudo sin querer.

  • Bloquear para sacar una página del índice

    Una URL bloqueada por robots.txt puede seguir indexada, porque Google la conoce por los enlaces y simplemente no puede leerla. Retirarla exige un noindex, y para eso hay que permitir la recuperación.

Comprobador de robots.txt para IA: preguntas frecuentes

¿«User-agent: *» se aplica además de mi bloque específico?

No. Un rastreador elige exactamente un bloque, el que coincide con mayor precisión con su nombre, e ignora los demás. Si creas un bloque para GPTBot, las reglas bajo * dejan de aplicársele. Todo lo que deba seguir vigente hay que repetirlo allí.

¿Basta el robots.txt para retirar una página de Google?

No, y es uno de los malentendidos más caros del SEO técnico. El archivo impide el rastreo, no la indexación. Google puede seguir listando una URL bloqueada si hay enlaces hacia ella, entonces sin descripción. Para retirarla, aplica un noindex y permite la recuperación para que Google pueda verlo.

¿Cómo bloqueo el entrenamiento de IA sin perder visibilidad?

Bloquea los rastreadores de entrenamiento y permite los de búsqueda. En OpenAI: bloquear GPTBot, permitir OAI-SearchBot. En Anthropic: bloquear ClaudeBot, permitir Claude-SearchBot. En Google, Google-Extended regula el uso por IA mientras Googlebot sigue sirviendo la búsqueda.

¿Qué ocurre si mi robots.txt tiene un error de sintaxis?

Los rastreadores omiten las líneas que no entienden y evalúan el resto. Eso es más peligroso que un fallo rotundo: una directiva mal escrita no se anuncia, simplemente no surte efecto. Por eso esta comprobación evalúa el resultado real por bot, no solo la sintaxis.

¿Tiene sentido Crawl-delay en un robots.txt moderno?

Para Google no, porque ignora la directiva. Otros rastreadores la tratan de forma desigual. Si el problema real es la carga del servidor, la limitación de velocidad en servidor o CDN y un sitemap limpio son medios más fiables.

Fuentes primarias

Las afirmaciones de esta página proceden de la documentación de los proveedores, no de resúmenes de segunda mano. Cada fuente está enlazada para que puedas leer lo que dice realmente.

Continuar con Contextter

Las reglas cambian sin que nadie las cambie

La mayoría de los problemas de robots.txt no nacen al escribir el archivo sino después: en un rediseño, una migración de CDN, una actualización de plugin.

  • Reevalúa las reglas de acceso en cada ejecución e informa cuando el resultado cambia para un bot.
  • Muestra el efecto sobre URL que existen realmente en lugar de limitarse a validar el archivo.
  • Asocia los bloqueos de rastreo con las páginas afectadas para que veas lo que cuesta el error.

No hace falta método de pago. La comprobación gratuita de arriba sigue siendo usable sin cuenta.

Herramientas gratuitas relacionadas

Cómo continúa en Contextter

Usa Site Audit para verificar a escala si robots.txt, el CDN o la aplicación bloquean páginas importantes.

Continuar en Contextter

Lista cuando tú lo estés.

Inicia la comprobación en el formulario superior. Los procesos intensivos requieren una breve verificación del navegador y aplican límites estrictos.

Las entradas solo se usan para la comprobación elegida. Las herramientas locales nunca suben textos pegados ni archivos.

No hace falta método de pago. La comprobación gratuita de arriba sigue siendo usable sin cuenta.