utilix.mx
/
Ver todas →
/

Generador de Robots.txt — Configura el rastreo de tu sitio

Genera un archivo robots.txt personalizado para controlar cómo los motores de búsqueda rastrean tu sitio web.


Reglas por agente

Agente #1

Cómo usar

  1. Usa los botones de preset para empezar rápido: 'Permitir todo' abre tu sitio a todos los rastreadores; 'Bloquear todo' cierra todo.
  2. Agrega la URL de tu sitemap (recomendado) para que los rastreadores encuentren todas tus páginas.
  3. Activa 'Bloquear rastreadores de IA' si no quieres que bots como GPTBot o CCBot usen tu contenido para entrenar modelos.
  4. Configura las reglas por agente: elige el rastreador, agrega rutas Allow y Disallow (una por línea) y un Crawl-delay opcional.
  5. Haz clic en '+ Agregar otro agente' para crear reglas específicas por rastreador.
  6. Copia el resultado o descárgalo como robots.txt y súbelo a la raíz de tu dominio.

Preguntas frecuentes

¿Qué es el archivo robots.txt?

Es un archivo de texto en la raíz de tu dominio que indica a los rastreadores web (Googlebot, Bingbot, etc.) qué páginas pueden o no pueden indexar. Es el primer archivo que visitan los bots al llegar a tu sitio.

¿El robots.txt afecta el SEO?

Indirectamente sí. Bloquear páginas innecesarias (admin, APIs) concentra el crawl budget en las páginas importantes. No bloquees páginas que quieres que rankeen.

¿Qué es el crawl budget?

Es el número de páginas que Googlebot puede rastrear en tu sitio en un período determinado. Sitios grandes deben administrarlo cuidadosamente para que Google indexe las páginas más importantes.

¿Puedo bloquear rastreadores de IA?

Sí. Puedes añadir reglas para GPTBot (OpenAI), CCBot (Common Crawl), Claude-Web (Anthropic) y otros bots de IA para evitar que usen tu contenido para entrenar modelos.

¿Qué diferencia hay entre Allow y Disallow?

Disallow bloquea el acceso a una ruta. Allow permite acceso a una ruta dentro de una sección bloqueada. Ejemplo: Disallow: /blog/ + Allow: /blog/publico/ bloquea todo el blog excepto /publico/.

¿Debo incluir el Sitemap en robots.txt?

Sí, es una buena práctica. La línea Sitemap: https://tusitio.com/sitemap.xml ayuda a los rastreadores a encontrar todas tus URLs más rápido.

¿El robots.txt protege páginas privadas?

No. Es una convención voluntaria — los bots bien portados la respetan, pero no es seguridad. Para proteger páginas privadas usa autenticación real, no robots.txt.

¿Cada cuánto debo actualizarlo?

Actualízalo cuando cambies la estructura de tu sitio, agregues secciones privadas nuevas o quieras ajustar qué bots rastrean qué secciones.