GEO

Rastreador de IA

By Jake Luo · Published 25 ago 2026

Un rastreador de IA es un cliente automatizado que descarga tus páginas por encargo de un sistema de IA y no de una página de resultados de búsqueda. El nombre engloba al menos tres trabajos distintos —recopilar texto que quizá entrene un modelo futuro, construir el índice del que tira un motor de respuestas y descargar una página en vivo porque alguien acaba de preguntar por ella— y cada trabajo suele tener su propio bot con su propio nombre. Así que bloquear "los rastreadores de IA" no es una decisión: son tres, y solo una de ellas determina si un asistente puede citarte.

Tres trabajos, tres tipos de bot

Casi todos los consejos contradictorios sobre los bots de IA vienen de gente que describe trabajos distintos usando la misma palabra para todos. La forma útil de ordenarlos es por *para qué* sirve la descarga, porque eso es lo que decide cuánto te cuesta rechazarla.

  • Los rastreadores de entrenamiento recopilan texto que puede acabar en los datos de entrenamiento de un modelo que todavía no existe. GPTBot de OpenAI, ClaudeBot de Anthropic y CCBot del proyecto Common Crawl son los que más se nombran. Echarlos no cambia nada sobre si te citan hoy.
  • Los rastreadores de índice construyen el índice de recuperación que un motor de respuestas consulta en el momento de responder: OAI-SearchBot de OpenAI y PerplexityBot son los ejemplos más claros. Este es el grupo cuya ausencia te cuesta citas en IA, y es el grupo que la gente bloquea sin querer.
  • Los descargadores activados por el usuario piden una sola página porque alguien pegó un enlace o preguntó por ella, y por eso OpenAI llama al suyo ChatGPT-User. En la práctica se parecen más a alguien haciendo clic en un enlace que a un rastreo, y llegan de página en página.
  • Los que nunca se identifican. Buena parte del tráfico automatizado se presenta como un navegador corriente, o no envía identificación alguna. Ninguna regla de robots los alcanza, porque una regla de robots es una petición dirigida a un nombre.

Qué decide de verdad robots.txt y qué no

robots.txt es un conjunto de peticiones por agente de usuario, atendidas de forma voluntaria por quien decide leerlas. Gobierna la descarga, y solo la descarga. No puede retirar texto ya recopilado, no obliga a un cliente que la ignora y —conviene recordarlo antes de escribir uno muy largo— es un archivo público, así que la lista de rutas que preferirías que nadie leyera la puede leer cualquiera.

El control que más se malinterpreta es Google-Extended, porque no es un rastreador. Google lo documenta como un identificador que gobierna si el contenido que Googlebot ya descargó puede ayudar a mejorar sus productos generativos, y afirma que no afecta a la inclusión en la Búsqueda. No es, por tanto, el interruptor de las Vistas Generales de IA, que se generan a partir del índice normal de la Búsqueda y se rigen por los controles normales de fragmentos. Añadir Google-Extended hace menos de lo que casi todo el mundo cree, y recurrir a Googlebot para lograr el efecto que buscaban los sacaría de la Búsqueda por completo.

La misma asimetría recorre todo el archivo. Cada regla que escribes apunta a un bot que se identifica con honestidad y decide obedecer: es decir, al extremo educado del tráfico, y no al extremo que probablemente sea el motivo por el que empezaste a leer sobre esto.

¿Entonces hay que bloquearlos?

Lo incómodo de esta decisión es que es asimétrica en el tiempo. Permitir un rastreador tiene un coste visible e inmediato: peticiones golpeando tu servidor esta tarde. Bloquearlo tiene un coste invisible que llega meses después, en forma de respuestas que citan a otro. Tres casos se separan con claridad:

  • Vendes a gente que hace preguntas a los asistentes. Permite los rastreadores de índice y deja de preocuparte por los de entrenamiento. Ser recuperable es la condición previa de todo lo demás en la optimización para motores generativos; no existe una versión de que te citen que empiece por que no te lean.
  • Tu contenido es el producto: un archivo de pago, un curso, un conjunto de datos que licencias. Ahí la cuestión del entrenamiento es una decisión comercial de verdad y no un reflejo, y negarse es defendible. Ten claro que solo mira hacia adelante, y que los rastreadores de índice son una decisión aparte que puedes responder de otro modo.
  • Lo que de verdad te preocupa es la carga del servidor. Entonces los bots de IA con nombre seguramente no son tu problema, y el diagnóstico corresponde al presupuesto de rastreo y a los registros de tu servidor, no a una regla de robots.

Para la mayoría de startups pequeñas, lo honesto por defecto es permitir los rastreadores con nombre y dedicar la tarde ahorrada a merecer que te citen: una página limpia y factual que responda una pregunta en un pasaje extraíble hace mucho más por la citación que cualquier regla de robots. Un archivo llms.txt es un añadido barato encima, no un sustituto de ser descargable.

Lo que aprendimos: manda la lista, y la lista puede estar mal

AgentCeres —el AI Growth Officer de agentceres.com— se topó con el filo de esto en su propio sitio de marketing. Nuestro framework sirve un HTML ligeramente distinto a los rastreadores que a los navegadores, y lo decide una lista incorporada de agentes de usuario de rastreadores. Googlebot no estaba en esa lista por defecto, mientras que el agente de la prueba de URL en vivo de Search Console sí. Así que la prueba en vivo renderizaba una página impecable cada vez que la mirábamos, y los rastreos reales recibían las etiquetas canonical y hreflang por debajo del cierre de la cabecera, donde no cuentan. Se registraron unas noventa páginas como duplicadas sin canónica elegida por el usuario antes de que lo encontráramos, y sobrevivió tanto tiempo porque la herramienta con la que verificábamos estaba en una lista distinta a la del rastreador que nos importaba.

La generalización vale más que el fallo. Cualquier comportamiento que trate a un rastreador distinto de otro depende de que un nombre coincida con una lista, y ambas mitades se pudren: los bots se renombran y se dividen, y las listas las escriben personas adivinando los nombres del año que viene. Debajo hay una segunda trampa: nuestra CDN cachea por URL y no por agente de usuario, así que la variante de una página que se cachee primero es la que reciben todos los visitantes y todos los bots posteriores. El comportamiento por rastreador es bastante más fácil de configurar que de entregar de verdad, lo cual es un argumento más a favor de un sitio que sirva a todos la misma página honesta.

FAQ

¿Bloquear GPTBot impide que ChatGPT cite mi sitio?
No, y esta es la confusión más común. GPTBot es el rastreador de entrenamiento de OpenAI. Sus funciones de búsqueda y navegación llegan a tus páginas mediante OAI-SearchBot y ChatGPT-User, que son nombres distintos en tu robots.txt. Bloquear GPTBot rechaza el entrenamiento sin tocar la citación; bloquear los otros dos es lo que te saca de las respuestas.
¿Google-Extended controla si aparezco en las Vistas Generales de IA?
No. Google documenta Google-Extended como algo que gobierna si el contenido ya rastreado ayuda a mejorar sus productos generativos, y afirma que no afecta a la inclusión en la Búsqueda. Las Vistas Generales de IA se construyen desde el índice normal de la Búsqueda, así que siguen los controles normales —las directivas de fragmento— y no Google-Extended.
¿Cómo veo qué rastreadores de IA visitan de verdad mi sitio?
Lee los registros de acceso de tu servidor o de tu CDN y agrúpalos por agente de usuario. Las herramientas de analítica no te lo van a mostrar, porque su JavaScript nunca se ejecuta para un rastreador. Cuenta con que una buena parte del tráfico automatizado no esté identificada, y toma los bots con nombre como la parte del cuadro sobre la que sí puedes razonar.
Related terms
Optimización para Motores Generativos (GEO)Cita de IAPresupuesto de rastreollms.txt

An AI growth team that runs this for you

AgentCeres is a managed AI marketing team — you approve what ships. 14-day free trial, from $39/month.

Start free trialBrowse the glossary