robots.txt - el cartel de "prohibido el paso" de los sitios web

En el directorio raíz de prácticamente todos los sitios web existe un archivo de texto llamado robots.txt. Este archivo es un mecanismo para indicar a los crawlers (bots) de los motores de búsqueda "por favor, no rastreen esta página". Tiene su origen en el "Robots Exclusion Protocol" propuesto por Martijn Koster en 1994 y durante mucho tiempo se usó como una costumbre sin especificación escrita, hasta que en septiembre de 2022 se convirtió en RFC 9309, un documento del proceso de estandarización (Standards Track) del IETF. Entre los autores de ese RFC figura Koster, el autor de la propuesta original.

Sin embargo, robots.txt guarda un secreto sorprendente: es una "petición", no una "orden".

robots.txt no tiene fuerza legal vinculante

robots.txt es un "acuerdo de caballeros" con los crawlers. Google, Bing, Yahoo y otros motores de búsqueda importantes respetan robots.txt, pero técnicamente cualquier bot puede ignorarlo y rastrear el sitio. Los scrapers maliciosos y los bots de spam, naturalmente, ignoran robots.txt.

Es decir, robots.txt es una "petición a los bots bien intencionados" y no una medida de seguridad. Es el propio documento del estándar el que lo dice: la sección de consideraciones de seguridad del RFC 9309 señala que el Robots Exclusion Protocol no sustituye a unas medidas adecuadas de protección del contenido y que, si se quiere controlar el acceso a esas rutas, hay que emplear un mecanismo de la capa de aplicación que sirve el archivo, como la autenticación HTTP. "Ocultar" páginas con información confidencial mediante robots.txt es como poner un cartel de "prohibido robar" en la puerta de entrada. Para una protección real es imprescindible configurar correctamente las cabeceras de seguridad HTTP.

robots.txt filtra información sin querer

Irónicamente, robots.txt publica una lista de "lo que se quiere ocultar". La misma sección del RFC 9309 advierte precisamente de esto: enumerar rutas en el archivo las hace públicas y descubribles. Los atacantes revisan robots.txt primero, y a partir de las rutas especificadas con Disallow, deducen la existencia de paneles de administración, entornos de staging, APIs internas, archivos de respaldo, etc.

User-agent: *
Disallow: /admin/
Disallow: /staging/
Disallow: /api/internal/
Disallow: /backup/

Este robots.txt es equivalente a decirle al atacante "existen las rutas /admin/, /staging/, /api/internal/ y /backup/". Si sabes cómo leer correctamente la estructura de una URL, podrás entender mucho mejor lo que significan esas rutas.

Echando un vistazo al robots.txt de sitios famosos

Como robots.txt es un archivo público, cualquiera puede leerlo accediendo a https://example.com/robots.txt de cualquier sitio.

  • YouTube: sorprendentemente corto, un archivo de unas 30 líneas con poco más de 20 reglas Disallow. Al principio hay un comentario en broma que dice que el archivo fue "creado en el futuro lejano (el año 2000) tras el levantamiento de los robots de mediados de los 90 que exterminó a toda la humanidad"
  • Wikipedia: bloquea ciertos bots por su nombre. Junto a la entrada de MJ12bot hay un comentario que explica el motivo: seguía descargando páginas en masa e ignoraba las respuestas 429 (demasiadas peticiones)
  • CIA (cia.gov): enumera más de 30 nombres de bots y rechaza a la mayoría por completo con Disallow: /. Además pide a todos los crawlers un Crawl-delay: 10 (un intervalo de 10 segundos), lo que muestra que los sitios de las agencias gubernamentales funcionan con el mismo mecanismo
  • Amazon: permite el rastreo de páginas de productos pero excluye el carrito, las cuentas y los resultados de búsqueda interna

robots.txt y la nueva batalla con los crawlers de IA

Desde 2023, la recopilación de datos de entrenamiento para la IA generativa ha vuelto a poner el papel de robots.txt en primer plano. El punto de inflexión fue 2023, cuando OpenAI publicó el nombre de su crawler de entrenamiento GPTBot junto con la forma de rechazarlo; a partir de ahí, muchos sitios de noticias y editoriales empezaron a añadir reglas orientadas a la IA en su robots.txt. El CCBot del ejemplo de código de abajo es el bot de recopilación de Common Crawl, que funciona desde mucho antes del auge de la IA generativa, pero como su archivo público se usa para el entrenamiento, cada vez se lo incluye más entre los bots rechazados.

El nombre que más confusión genera es Google-Extended. Suele mencionarse junto a los anteriores, pero no es un crawler independiente. No tiene un agente de usuario propio: es solo un nombre que sirve para indicar en robots.txt si el contenido ya recopilado puede usarse para el entrenamiento y el respaldo de respuestas en productos como Gemini, y no afecta a la inclusión del sitio en la Búsqueda de Google.

User-agent: GPTBot
Disallow: /

User-agent: CCBot
Disallow: /

Sin embargo, incluso después de haberse estandarizado como RFC 9309, robots.txt sigue siendo una "petición". No hay garantía de que todos los crawlers de IA lo respeten y, incluida su relación con las leyes de derechos de autor, en agosto de 2026 el papel de robots.txt en la era de la IA sigue en discusión. Si te preocupa la recopilación de datos por parte de los crawlers de IA, puedes considerar el uso de buscadores centrados en la privacidad.

Resumen

robots.txt ha recorrido el camino desde la propuesta de 1994 hasta la estandarización como RFC 9309 en 2022, y sigue usándose como la "norma de cortesía" de internet. No tiene fuerza legal vinculante ni sirve como medida de seguridad, pero es una herramienta importante para gestionar la relación con los motores de búsqueda. El robots.txt de IP Check-san está configurado tanto para que los motores de búsqueda rastreen el sitio adecuadamente como para indicar, bot por bot, qué crawlers orientados a la IA tienen permiso. Cualquiera puede leer ese archivo, así que si te da curiosidad, ve a ver el original.

Términos del glosario relacionados

Bot Programas automatizados que robots.txt intenta controlar. Desde crawlers de motores de búsqueda hasta scrapers maliciosos. DNS Cuando un crawler accede a un sitio, primero resuelve el dominio mediante DNS. HTTPS El propio robots.txt se sirve mediante HTTPS, protegiéndolo contra alteraciones. Dirección IP La IP de origen del crawler. Los bots maliciosos a veces se bloquean por IP.

Preguntas frecuentes

¿Qué es robots.txt?

robots.txt es un archivo de texto plano colocado en la raíz de un sitio web que indica a los rastreadores qué páginas deben o no deben visitar. Sigue el Protocolo de Exclusión de Robots, estandarizado como RFC 9309 en septiembre de 2022, pero cumplirlo queda a criterio de cada rastreador y el archivo no tiene fuerza legal.

¿Es robots.txt una medida de seguridad?

No. robots.txt es de acceso público y solo funciona como una petición cortés a los rastreadores bien educados. Los bots maliciosos lo ignoran por completo. Peor aún, listar rutas sensibles en las reglas Disallow en realidad anuncia su existencia. Para un control de acceso real, usa autenticación y autorización.

¿Puede robots.txt bloquear los rastreadores de inteligencia artificial?

Puedes añadir reglas Disallow para los agentes de usuario de rastreadores de IA conocidos como GPTBot y CCBot. Google-Extended suele mencionarse junto a ellos, pero no es un rastreador independiente: es solo un nombre que sirve para indicar si el contenido ya recopilado puede usarse para el entrenamiento y el respaldo de respuestas. El cumplimiento es voluntario, aparecen nuevos rastreadores con frecuencia y, en agosto de 2026, su situación legal sigue en discusión.