Generador de Robots.txt

Define el rastreador al que te diriges, enumera las rutas que quieres bloquear y las que quieres permitir, añade un crawl-delay opcional y apunta a tu sitemap, y el generador ensambla un robots.txt con el formato correcto que puedes copiar y desplegar. Se encarga del formato exacto de las líneas y la puntuación para que no tengas que memorizar la sintaxis ni la ortografía de los user-agent.

Cómo generar el archivo

  1. 1

    Define el user-agent

    Introduce el rastreador al que se aplican las reglas, o deja * para dirigirte a todos los bots.

  2. 2

    Enumera las rutas a bloquear

    Añade los directorios o rutas a bloquear, uno por línea, por ejemplo /admin/ o /checkout/.

  3. 3

    Enumera las rutas a permitir

    Añade las rutas que deben seguir siendo rastreables, una por línea, para crear excepciones dentro de un Disallow más amplio.

  4. 4

    Añade sitemap y crawl-delay

    Declara la URL de tu sitemap y, si lo necesitas, un crawl-delay en segundos.

  5. 5

    Copia y despliega

    Copia el archivo generado y colócalo en https://tudominio.com/robots.txt, en la raíz, no en un subdirectorio.

Plantillas de inicio típicas

Permitir todo (la mayoría de los sitios):

User-agent: *
Allow: /
Sitemap: https://example.com/sitemap.xml

Bloquear staging / admin:

User-agent: *
Disallow: /admin/
Disallow: /staging/
Disallow: /cart/
Disallow: /checkout/
Disallow: /*?session=
Sitemap: https://example.com/sitemap.xml

Bloquear crawlers de entrenamiento de IA, permitir motores de búsqueda:

User-agent: GPTBot
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: anthropic-ai
Disallow: /

User-agent: *
Allow: /
Sitemap: https://example.com/sitemap.xml

User-agents que vale la pena conocer

User-agent Propietario Propósito
Googlebot Google Search Indexación web
Googlebot-Image Google Búsqueda de imágenes
Google-Extended Google Entrenamiento de Bard/Gemini (opción de exclusión)
Bingbot Microsoft Búsqueda en Bing
DuckDuckBot DuckDuckGo Búsqueda DDG
GPTBot OpenAI ChatGPT / entrenamiento (opción de exclusión)
ClaudeBot Anthropic Entrenamiento de Claude (opción de exclusión)
CCBot Common Crawl Corpus utilizado por muchos LLMs
AhrefsBot Ahrefs Índice de backlinks de SEO
SemrushBot Semrush Investigación de SEO
MJ12bot Majestic Investigación de SEO

Los bots de entrenamiento de IA son de exclusión por convención, no por requisito legal; los operadores de buena fe respetan las directrices, los menos escrupulosos no lo hacen.

Reglas de coincidencia de rutas

  • Las rutas son relativas a la raíz del dominio, comenzando con /.
  • * coincide con cualquier carácter. Disallow: /*.pdf$ bloquea todos los PDFs.
  • $ ancla al final de la URL. Disallow: /*/trash$ bloquea /foo/trash pero no /foo/trashes/....
  • La coincidencia más larga gana. Allow: /admin/public/ anula Disallow: /admin/ para esa subruta.
  • Las rutas son sensibles a mayúsculas.

Cosas que robots.txt no puede hacer

  • Eliminar una página de Google. Usa una etiqueta meta noindex en la propia página.
  • Proteger una URL de humanos. robots.txt es público y solo sugerencias para bots cumplidores.
  • Limitar la tasa de Googlebot. Crawl-delay es ignorado por Google; usa Search Console.
  • Bloquear bots que ignoran robots.txt. Los scrapers de spam no leen el archivo.

Lista de verificación de implementación

  1. Colocar en https://yourdomain.com/robots.txt, solo en la raíz.
  2. Servir con Content-Type: text/plain (la mayoría de los servidores hacen esto automáticamente).
  3. Tamaño: menos de 500 KB. Google trunca archivos más grandes.
  4. Después de implementar, verifica el archivo obtenido en el probador de robots.txt de Google Search Console.
  5. Al eliminar un Disallow, ten en cuenta que la desindexación puede tardar semanas.

Preguntas frecuentes

No estrictamente. Sin uno, los rastreadores asumen “permitir todo”. Si tienes algo que bloquear, staging, admin, checkout, búsqueda interna, necesitas uno.

Puedes pedirles que se detengan a través de bloques de user-agent como GPTBot, ClaudeBot, CCBot y Google-Extended. Los principales operadores respetan estos; los scrapers menos escrupulosos los ignoran por completo.

Los rastreadores son indulgentes: las directrices desconocidas son ignoradas. Los errores graves (HTTP 404 o 500) se tratan como “permitir todo”. Valida el archivo antes de enviarlo.

En la raíz de cada host que deseas cubrir, https://www.example.com/robots.txt y https://example.com/robots.txt son archivos separados para hosts separados.

No. Las rutas que introduces solo se usan para ensamblar el archivo; no se guardan ni se registran.

Herramientas relacionadas

Herramienta disponible en otros idiomas