Probador de Robots.txt
Introduce una URL para comprobar al instante si Googlebot y otros bots pueden rastrear esa página según robots.txt.
¿Qué es el Probador de Robots.txt?
Robots.txt es un archivo en el directorio raíz de tu sitio que indica a los bots de los buscadores qué páginas pueden rastrear. Esta herramienta evalúa la URL que introduces según las reglas de robots.txt del sitio y muestra si un bot como Googlebot puede rastrear esa página y qué regla se aplica.

Cómo usarla
- 1Introduce la URL completa que quieres probar (p. ej. https://tusitio.com/pagina-privada).
- 2Elige un bot (por defecto: Googlebot) y pulsa 'Comprobar'.
- 3Ve el resultado: si la página es rastreable, qué regla coincidió y los sitemaps.
Cómo interpretar el resultado
Cuándo usarlo
Lanzamiento a producción
Verifica al instante si olvidaste retirar la directiva Disallow: / del entorno de staging antes de publicar la web para no arruinar tu tráfico orgánico.
Auditoría de filtros
Comprueba si las reglas complejas diseñadas para bloquear parámetros de ordenación o facetas en tu tienda online aíslan solo las URL deseadas sin tocar categorías clave.
Páginas de captación
Confirma antes de invertir en publicidad que tus landing pages exclusivas para campañas de pago queden cerradas a los rastreadores y no consuman crawl budget innecesario.
Errores comunes
Usar directiva Noindex
Añadir Noindex en robots.txt no es compatible con Google; bloquea el rastreo pero no asegura la desindexación. Debes gestionar la exclusión con metaetiquetas robots en HTML.
Comodines demasiado genéricos
Emplear asteriscos o signos de interrogación sin acotar el patrón puede clausurar directorios enteros por error y dejar productos o categorías fuera del rastreo de Googlebot.
Ubicación en subcarpetas
Guardar este fichero en subdirectorios como /blog/robots.txt carece de validez técnica. Los motores de búsqueda únicamente interpretan las directivas alojadas en la raíz exacta del dominio.
Preguntas frecuentes
Mi página sale 'Bloqueada', ¿qué hago?
Si quieres que esa página aparezca en Google, elimina o restringe la regla Disallow correspondiente en robots.txt. Las páginas bloqueadas no suelen rastrearse.
Si robots.txt bloquea una página, ¿nunca saldrá en Google?
Robots.txt bloquea el rastreo; pero una URL enlazada desde otros sitios aún puede indexarse sin que se rastree su contenido. Para excluir una página por completo, usa una etiqueta meta 'noindex' en vez de robots.txt.
Si Allow y Disallow chocan, ¿cuál gana?
En Google gana la regla coincidente más larga (más específica); si la longitud es igual, prevalece Allow. Esta herramienta aplica la misma lógica.
¿Qué pasa si no tengo robots.txt?
Sin robots.txt, los bots rastrean todas las páginas por defecto. No es un problema; robots.txt no es obligatorio para la mayoría de los sitios pequeños.
¿Cuánto tarda Google en detectar cambios en el robots.txt?
Suele tardar entre 24 y 48 horas en refrescar su copia en caché del archivo. Googlebot rastrea el robots.txt con frecuencia según la actividad del dominio. Si necesitas una actualización urgente, puedes forzar la revisión enviando la URL actualizada mediante las herramientas de inspección en Google Search Console.
¿Bloquear un subdirectorio afecta automáticamente a todas sus subpáginas?
Sí, cualquier regla de bloqueo aplicada a un directorio abarca por defecto todas las rutas descendientes. Por ejemplo, bloquear /privado/ restringe también /privado/informes.html. Si deseas abrir un archivo concreto situado dentro de esa misma carpeta bloqueada, debes declarar una regla Allow específica para esa ruta exacta.