Analizador de robots.txt: qué puede leer cada bot, incluidos los de IA.
Pega tu robots.txt y comprueba en segundos qué pueden rastrear Googlebot, Bing, GPTBot, ClaudeBot, PerplexityBot y el resto de bots de IA para la ruta que elijas. Parser fiel al estándar: grupos por user-agent, comodines * y $, y la regla más específica gana. Sin registro, sin enviar nada a ningún servidor.
El archivo robots.txt es lo primero que consulta cualquier rastreador educado (buscador o asistente de IA) antes de acceder a tu web. Pega aquí el contenido de tu robots.txt (no hace falta que esté publicado ni que sea tuyo) y esta herramienta te dice, regla por regla, si Googlebot, Bing, GPTBot, ClaudeBot, PerplexityBot y otros bots de IA pueden acceder a una ruta concreta. Todo el análisis ocurre en tu navegador: no enviamos tu robots.txt a ningún servidor.
Si lo que quieres es comprobar el robots.txt EN VIVO de un dominio real (el que su servidor está sirviendo ahora mismo, más llms.txt y datos estructurados), usa la herramienta hermana: Test de visibilidad en IA.
¿Quieres que revisemos tu robots.txt a mano?
Te enviamos por email este análisis junto con una primera valoración de nuestro equipo sobre qué bots de IA te conviene permitir o bloquear. Sin compromiso.
Qué analizamos exactamente
- Agrupación por User-agent: las líneas «User-agent:» consecutivas (sin ninguna regla entre medias) comparten el mismo grupo de reglas; si dos grupos distintos mencionan al mismo bot, sus reglas se combinan, tal y como especifica Google.
- Resolución del bot: para cada rastreador buscamos primero un grupo que lo mencione por su nombre EXACTO; si no existe, usamos el grupo genérico «User-agent: *»; si tampoco hay comodín, el rastreador queda permitido por defecto.
- Comodines:
*coincide con cualquier secuencia de caracteres (incluida ninguna) y$marca el final exacto de la ruta: sin él, la regla también coincide con rutas que continúan después del patrón. - Prioridad entre reglas: cuando varias reglas de un mismo grupo coinciden con la misma ruta, gana la de patrón más largo (más específica); si hay empate exacto de longitud, gana el Allow.
- Avisos estructurales: bloqueo global accidental del sitio, ausencia de línea Sitemap, reglas Allow/Disallow «huérfanas» (antes de cualquier User-agent, que ningún rastreador aplica) y uso de Crawl-delay, que Google ignora por completo aunque otros motores sí lo respeten.
Todo el cálculo ocurre en tu navegador: no enviamos tu robots.txt a ningún servidor para analizarlo.
Preguntas frecuentes
¿Qué es el robots.txt y qué NO es?
Es un archivo de texto público en la raíz del dominio (p. ej. tudominio.com/robots.txt) que le pide a los rastreadores educados qué rutas prefieres que no visiten. NO es una medida de seguridad ni una forma de ocultar contenido: es público (cualquiera puede leerlo) y un rastreador que decida ignorarlo, técnicamente puede hacerlo. Los buscadores y asistentes de IA serios sí lo respetan.
¿Qué significa «Permitido (sin reglas)» en la tabla?
Que tu robots.txt no menciona a ese rastreador (ni por su nombre exacto ni a través de un grupo «User-agent: *») y no hay ninguna regla que le aplique en la ruta comprobada. Por convención del estándar, la ausencia de reglas equivale a acceso permitido: robots.txt es una lista de excepciones, no una lista blanca.
Tengo un Allow y un Disallow que coinciden con la misma ruta. ¿Cuál gana?
Gana la regla con el patrón más largo (más caracteres en su valor, contando los comodines), porque se considera la más específica. Si ambas reglas tienen exactamente la misma longitud, gana el Allow: es el criterio de desempate que documenta la propia especificación de robots.txt de Google («si hay reglas en conflicto, Google usa la menos restrictiva»). Esta herramienta implementa ese mismo criterio.
¿Bloquear GPTBot, CCBot o ClaudeBot me saca de las respuestas de ChatGPT, Perplexity o Claude?
Depende de qué bot bloquees y para qué se usa. GPTBot, CCBot y ClaudeBot se usan sobre todo para RECOPILAR contenido con el que entrenar modelos: bloquearlos evita que tu web se use como material de entrenamiento futuro, pero muchos asistentes usan OTROS user-agents específicos para la búsqueda o la navegación en directo (p. ej. OAI-SearchBot de OpenAI) que sí pueden seguir citándote en una respuesta si les das acceso. Si bloqueas TODOS los bots de un proveedor, incluidos los de búsqueda en directo, entonces sí puedes quedar fuera de sus respuestas.
¿El robots.txt sirve para ocultar una URL privada o confidencial?
No. Es una petición pública y voluntaria: el propio archivo es visible para cualquiera, así que bloquear una ruta en él puede incluso señalar su existencia a quien lo lea. Además, una URL bloqueada por robots.txt puede seguir apareciendo indexada en Google (sin título ni descripción) si hay enlaces externos hacia ella. Para ocultar contenido de verdad, usa autenticación o control de acceso; y si usas la etiqueta noindex, no bloquees a la vez el rastreo de esa URL en robots.txt, porque entonces Google no podrá ni leer la etiqueta.
3 casos de uso
1) Antes de un rediseño o migración: pega el robots.txt nuevo (o el que planeas subir) antes de publicarlo, para confirmar que no bloqueas por accidente a Googlebot o a otros motores. 2) Decidir tu estrategia frente a la IA: comprueba, bot a bot, si te conviene bloquear el entrenamiento (GPTBot, ClaudeBot, CCBot) mientras permites la búsqueda en directo (OAI-SearchBot, PerplexityBot): cada vez más webs tratan esto como una decisión matizada, no como todo o nada. 3) Auditoría de competencia: pega el robots.txt público de un competidor o de un medio de referencia para ver qué bots bloquea y comparar con tu propia estrategia.
Qué NO hace esta herramienta
1) Analiza el TEXTO que pegas, no el robots.txt que tu servidor sirve de verdad ahora mismo: para comprobar el que está EN VIVO en un dominio, usa el Test de visibilidad en IA. 2) No verifica si el archivo se sirve con el código de estado y el Content-Type correctos (un robots.txt servido como página de error 404 puede no ser respetado por los rastreadores, y esta herramienta no puede detectarlo sobre un texto pegado a mano). 3) Solo compara el nombre EXACTO del user-agent: no modela «familias» de bots (p. ej. Googlebot-Image o Googlebot-News se tratan en la práctica como rastreadores aparte, no como sinónimos automáticos de Googlebot). 4) La lista de 10 bots es una fotografía de julio de 2026: los proveedores de IA añaden, renombran o dividen user-agents con cierta frecuencia. 5) No comprueba direcciones IP: algunos proveedores publican rangos oficiales para verificar que quien dice ser «GPTBot» lo es de verdad; esta herramienta solo interpreta las reglas de texto, no detecta la suplantación de un user-agent.
Herramientas profesionales
TechnicalSEO.com, robots.txt Validator and Testing Tool: comprueba una URL y un user-agent concretos contra un robots.txt real, gratis y sin registro. Informe de robots.txt en Google Search Console: sustituyó en diciembre de 2023 al antiguo «robots.txt Tester»; muestra los robots.txt que Google ha encontrado para tu dominio, cuándo los rastreó por última vez y permite solicitar un nuevo rastreo. google/robotstxt (GitHub): la librería en C++ de código abierto que usa el propio Googlebot para interpretar robots.txt: la referencia técnica definitiva para validar un caso límite contra el comportamiento real de Google. Screaming Frog SEO Spider: durante un rastreo completo, respeta y muestra qué URLs quedan bloqueadas por robots.txt, útil para ver el efecto agregado sobre miles de páginas.
El robots.txt dejó de ser cosa solo de Google
Durante más de tres décadas, revisar el robots.txt era sobre todo un ejercicio para no perder tráfico de búsqueda: comprobar que Googlebot y Bingbot podían rastrear lo importante. Desde que los asistentes de IA generativa empezaron a citar fuentes en sus respuestas, ese mismo archivo se convirtió también en la primera decisión (muchas veces tomada sin querer) sobre si tu contenido puede entrenar modelos, aparecer citado en una respuesta de ChatGPT o Perplexity, o ninguna de las dos cosas. El problema es que la mayoría de robots.txt en producción se escribieron antes de que existiera GPTBot, así que no reflejan ninguna decisión real: simplemente heredan un bloqueo o una apertura por defecto. Si quieres profundizar en la estrategia completa más allá de esta comprobación técnica, lee cómo aparecer en ChatGPT y Perplexity siendo una pyme española.
Ángel Ortega Castro
Director · Summum Marketing
Diez años liderando estrategia de marketing y comunicación para empresas españolas. Especialista en marketing local, BTL, neuromarketing y aplicación de IA al marketing. Director del laboratorio de neuromarketing de Summum Marketing desde 2016.
Herramientas relacionadas
Todas gratuitas y sin registro: Test de visibilidad en IA · Auditor SEO on-page · Test de salud del email. Las encontrarás todas en nuestro catálogo de herramientas.
¿Necesitas una estrategia técnica completa frente a la IA?
Este análisis es un primer diagnóstico gratuito. Para una auditoría técnica completa o una estrategia de visibilidad en buscadores y asistentes de IA, escríbenos. La primera consulta es gratis.
Pedir consulta gratuita→Seguir leyendo