Rastreadores de IA y robots.txt: qué permitir, bloquear.
Descubra cómo el archivo robots.txt afecta a los rastreadores de IA, por qué OAI-SearchBot es importante para ChatGPT Search y cómo los editores pueden.
Updated May 17, 2026
robots.txt sigue siendo importante en la era de la IA porque es el primer lugar donde muchos rastreadores automatizados buscan reglas de permiso. Si desea que el contenido sea reconocible en ChatGPT Search, OpenAI dice que se debe permitir que OAI-SearchBot rastree el sitio. Si desea restringir el acceso, robots.txt puede expresar esa elección, pero no puede resolver los problemas de atribución, pago o calidad del contenido por sí solo.
El papel de robots.txt#
Google describe robots.txt como la forma estándar de indicar a los rastreadores automatizados a qué partes de un sitio pueden acceder. Es un archivo de control de rastreo, no un archivo de clasificación, ni un sistema de gestión de derechos, ni un sustituto de la autenticación.
Fuentes primarias:
- Documentación de Google robots.txt
- OpenAI: ayuda a ChatGPT a descubrir tus productos
- Ayuda de OpenAI: Búsqueda ChatGPT
Los rastreadores de IA no son una sola cosa#
Diferentes bots realizan diferentes trabajos. OpenAI dice que OAI-SearchBot se utiliza para mostrar sitios web en ChatGPT Search y no es el rastreador utilizado para entrenar modelos básicos. Esa distinción es importante porque los propietarios de sitios pueden querer visibilidad de búsqueda mientras aplican reglas diferentes a otros usos automatizados.
| Categoría de robot | Propósito principal | Pregunta típica del editor |
| — |
| — |
| Rastreador de búsqueda |
| Rastreador de entrenamiento |
| Rastreador de comercio |
| Bot de seguridad o monitoreo |
Tratar a todos los bots como idénticos suele generar una mala política. Puede bloquear descubrimientos útiles sin proteger lo que realmente importa.
Una política práctica de robots.txt#
Empiece por la intención comercial:
| Gol | Dirección sensata |
| — |
| Maximizar la visibilidad de búsqueda |
| Proteger el contenido exclusivo para miembros |
| Excluir URL provisionales o facetadas |
| Apoyar el descubrimiento del comercio electrónico |
| Monetizar el acceso |
Para un sitio de comercio electrónico público que desea visibilidad de búsqueda de ChatGPT, esto puede ser relevante:
User-agent: OAI-SearchBot
Allow: /No copie las reglas a ciegas. Valide lo que el rastreador realmente recibe a través de su CDN, capa de protección contra bots y servidor de origen.
Errores comunes#
- Permitir el bot en
robots.txtpero bloquearlo en la CDN.2. Bloquear todos los agentes de usuario de IA y luego preguntarse por qué desaparecen las referencias de búsqueda de IA. - Tratar
robots.txtcomo seguridad para contenido privado. - Olvidar que las páginas de productos, documentación y soporte pueden necesitar políticas diferentes.
- Publicar reglas contradictorias en
robots.txt, encabezados y controles perimetrales.
La guía de control de rastreo de IA de Cloudflare cubre el lado de la política perimetral. La lista de verificación de recomendaciones de productos ChatGPT muestra por qué el acceso del rastreador es importante para el descubrimiento del comercio electrónico.
Qué monitorear#
| Señal | Por qué es importante |
| — |
| Registros del servidor por agente de usuario |
| Buscar referencias |
| Eventos de bloqueo de bots |
| Frescura de la página del producto |
| Errores de rastreo |
Para una medición más amplia de AEO, conecte los datos de rastreo con la guía de KPI de AEO.
robots.txt no es una estrategia AEO#
Una buena política de rastreo es sólo el punto de entrada. Los agentes todavía necesitan:
- estructura de página clara
- hechos precisos
- precio actual o disponibilidad
- enlaces internos
- datos de productos o servicios legibles por máquina
- caminos de acción seguros
Es por eso que robots.txt pertenece a la capa de lectura, mientras que la finalización de la tarea pertenece a la capa de ejecución.
Preguntas frecuentes#
¿Permitir OAI-SearchBot garantiza la visibilidad de ChatGPT?#
No. OpenAI dice que permitir el rastreador es importante para su inclusión, pero no garantiza la ubicación.
¿Puede el archivo robots.txt proteger el contenido privado?#
No. Utilice autenticación y autorización para contenido privado. robots.txt es una directiva de rastreo voluntaria.
¿Debería bloquear todos los rastreadores de IA?#
Ésta es una decisión empresarial, no una mejor práctica predeterminada. Separe los objetivos de visibilidad de búsqueda de las políticas de capacitación y monetización.
¿Cómo pruebo mi póliza?#
Verifique el robots.txt en vivo, inspeccione los registros del servidor y verifique que las URL importantes devuelvan el estado esperado a los agentes de usuario que desea admitir.
Conclusión#
La política de los rastreadores de IA debe ser deliberada, no emocional. Decida qué usos automatizados desea, exprese esas reglas con claridad y verifíquelas en el borde y en el origen antes de asumir que funcionan.