Guide

Rastreadores de IA y robots.txt: qué permitir, bloquear.

Descubra cómo el archivo robots.txt afecta a los rastreadores de IA, por qué OAI-SearchBot es importante para ChatGPT Search y cómo los editores pueden.

Updated May 17, 2026

robots.txt sigue siendo importante en la era de la IA porque es el primer lugar donde muchos rastreadores automatizados buscan reglas de permiso. Si desea que el contenido sea reconocible en ChatGPT Search, OpenAI dice que se debe permitir que OAI-SearchBot rastree el sitio. Si desea restringir el acceso, robots.txt puede expresar esa elección, pero no puede resolver los problemas de atribución, pago o calidad del contenido por sí solo.

El papel de robots.txt#

Google describe robots.txt como la forma estándar de indicar a los rastreadores automatizados a qué partes de un sitio pueden acceder. Es un archivo de control de rastreo, no un archivo de clasificación, ni un sistema de gestión de derechos, ni un sustituto de la autenticación.

Fuentes primarias:

Los rastreadores de IA no son una sola cosa#

Diferentes bots realizan diferentes trabajos. OpenAI dice que OAI-SearchBot se utiliza para mostrar sitios web en ChatGPT Search y no es el rastreador utilizado para entrenar modelos básicos. Esa distinción es importante porque los propietarios de sitios pueden querer visibilidad de búsqueda mientras aplican reglas diferentes a otros usos automatizados.

| Categoría de robot | Propósito principal | Pregunta típica del editor |

Rastreador de búsqueda
Rastreador de entrenamiento
Rastreador de comercio
Bot de seguridad o monitoreo

Tratar a todos los bots como idénticos suele generar una mala política. Puede bloquear descubrimientos útiles sin proteger lo que realmente importa.

Una política práctica de robots.txt#

Empiece por la intención comercial:

| Gol | Dirección sensata |

Maximizar la visibilidad de búsqueda
Proteger el contenido exclusivo para miembros
Excluir URL provisionales o facetadas
Apoyar el descubrimiento del comercio electrónico
Monetizar el acceso

Para un sitio de comercio electrónico público que desea visibilidad de búsqueda de ChatGPT, esto puede ser relevante:

User-agent: OAI-SearchBot
Allow: /

No copie las reglas a ciegas. Valide lo que el rastreador realmente recibe a través de su CDN, capa de protección contra bots y servidor de origen.

Errores comunes#

  1. Permitir el bot en robots.txt pero bloquearlo en la CDN.2. Bloquear todos los agentes de usuario de IA y luego preguntarse por qué desaparecen las referencias de búsqueda de IA.
  2. Tratar robots.txt como seguridad para contenido privado.
  3. Olvidar que las páginas de productos, documentación y soporte pueden necesitar políticas diferentes.
  4. Publicar reglas contradictorias en robots.txt, encabezados y controles perimetrales.

La guía de control de rastreo de IA de Cloudflare cubre el lado de la política perimetral. La lista de verificación de recomendaciones de productos ChatGPT muestra por qué el acceso del rastreador es importante para el descubrimiento del comercio electrónico.

Qué monitorear#

| Señal | Por qué es importante |

Registros del servidor por agente de usuario
Buscar referencias
Eventos de bloqueo de bots
Frescura de la página del producto
Errores de rastreo

Para una medición más amplia de AEO, conecte los datos de rastreo con la guía de KPI de AEO.

robots.txt no es una estrategia AEO#

Una buena política de rastreo es sólo el punto de entrada. Los agentes todavía necesitan:

  • estructura de página clara
  • hechos precisos
  • precio actual o disponibilidad
  • enlaces internos
  • datos de productos o servicios legibles por máquina
  • caminos de acción seguros

Es por eso que robots.txt pertenece a la capa de lectura, mientras que la finalización de la tarea pertenece a la capa de ejecución.

Preguntas frecuentes#

¿Permitir OAI-SearchBot garantiza la visibilidad de ChatGPT?#

No. OpenAI dice que permitir el rastreador es importante para su inclusión, pero no garantiza la ubicación.

¿Puede el archivo robots.txt proteger el contenido privado?#

No. Utilice autenticación y autorización para contenido privado. robots.txt es una directiva de rastreo voluntaria.

¿Debería bloquear todos los rastreadores de IA?#

Ésta es una decisión empresarial, no una mejor práctica predeterminada. Separe los objetivos de visibilidad de búsqueda de las políticas de capacitación y monetización.

¿Cómo pruebo mi póliza?#

Verifique el robots.txt en vivo, inspeccione los registros del servidor y verifique que las URL importantes devuelvan el estado esperado a los agentes de usuario que desea admitir.

Conclusión#

La política de los rastreadores de IA debe ser deliberada, no emocional. Decida qué usos automatizados desea, exprese esas reglas con claridad y verifíquelas en el borde y en el origen antes de asumir que funcionan.