SEO & content

¿Qué parte de mi tráfico web son realmente bots?

By Jake Luo · Published 1 sept 2026

Más de lo que muestra tu analítica, porque la analítica es el instrumento equivocado para esta pregunta concreta. Una etiqueta de JavaScript solo cuenta visitantes que ejecutan JavaScript, así que los rastreadores y scrapers simples no aparecen en absoluto, mientras que los que sí renderizan una página acaban clasificados como Directo y se leen como personas. Los registros del servidor o del CDN cuentan todas las peticiones, y ahí es donde vive la proporción real: en una muestra de tres horas de nuestros propios registros de origen, alrededor de tres cuartas partes de las peticiones venían de clientes de centros de datos con user agents falsificados o vacíos. Mídelo una vez desde los registros antes de volver a leer un gráfico de tráfico.

Tu etiqueta de analítica y tu registro de servidor cuentan cosas distintas

La pregunta es difícil porque los dos sitios donde podrías mirar discrepan por diseño, y ninguno de los dos miente. Una etiqueta de página se dispara desde el navegador después de que se ejecute JavaScript, así que cuenta clientes que renderizan: personas reales, más la minoría de bots que conducen un navegador completo. Un registro de servidor o de CDN anota todas las peticiones que llegaron a tu origen, así que cuenta descargas, incluido el rastreador que cogió tu sitemap y se llevó cuatrocientas páginas en un minuto sin ejecutar ni una línea de tu código. El mismo sitio puede declarar honestamente doscientas sesiones en analítica y doce mil peticiones en el borde el mismo día.

Qué número es el correcto depende de lo que estés decidiendo. Si quieres saber si lo que escribes llega a humanos, la etiqueta se acerca más a la verdad y el registro te va a halagar. Si quieres saber por qué se movió tu factura de alojamiento, por qué tu posicionamiento parece desconectado de tu gráfico de tráfico, o si el pico del martes pasado fue real, el registro es el único testigo. El error no es elegir mal entre los dos: es leer un número del instrumento que no puede ver aquello que estás preguntando.

  • Visible solo en el registro: los rastreadores simples. Rastreadores de búsqueda, rastreadores de IA, lectores de feeds, comprobadores de disponibilidad, escáneres de seguridad y los scrapers que republican tu contenido descargan el HTML y paran ahí. Ninguno ejecuta tu etiqueta de analítica, así que para tu panel ninguno existe.
  • Visible solo en el registro: todo lo que no es una página. Imágenes, tipografías, endpoints JSON, RSS, robots.txt y cada 404 que alguien fue tanteando. Aquí suele asomar primero cualquier patrón raro, porque un bot buscando paneles de administración no tiene ningún motivo para esconderse entre tus artículos.
  • Visible en ambos, y equivocado en ambos: los navegadores headless. Un bot que conduce un navegador real ejecuta tu etiqueta y llega como una sesión normal, con dispositivo, ubicación y referente. Son los que mueven tus medias en silencio, porque ninguna fila tiene nada raro vista por separado.
  • Visible solo en analítica: lo que pasó después de cargar la página. Desplazarse, hacer clic, rellenar un formulario, registrarse. Un registro te dice que se sirvió una página; nunca te dirá si la visita valió algo, y por eso la respuesta es leer los dos y no cambiar de uno a otro.

Las señales de que una sesión no es una persona

Casi nunca te encuentras una fila etiquetada como bot. Lo que te encuentras es un conjunto de imposibilidades que un visitante humano no podría producir, y son más fáciles de detectar de lo que parece porque el tráfico automatizado es malo siendo inconsistente a la manera de las personas. Coge cualquier segmento sospechoso y pregúntate si un solo cuerpo humano podría haberlo generado.

Lo que vesQué suele serPor qué se ve así
Un visitante registrado en varias ciudades y varios dispositivos en cuestión de segundosUn único cliente automatizado, partido en sesiones distintas por un pool de proxies rotatorioLos scrapers que compran proxies residenciales cambian de IP en cada petición, y la analítica deduce la ubicación y el dispositivo de cada una por separado.
Un grupo de sesiones sin ciudad ni región, todas con el mismo user agentUn solo script que nunca varió su huellaLos navegadores reales se diferencian entre sí; un cliente HTTP por defecto manda la misma cabecera siempre, y las bases de geolocalización a menudo no tienen nada útil para los rangos de direcciones de centros de datos.
Un ancho de ventana que nunca cambia, desde un pueblo pequeño al que nunca has vendidoUn navegador headless con su tamaño de ventana por defecto, corriendo en una región de nubeChrome headless abre con un tamaño fijo salvo que se le indique otra cosa, y las regiones de nube están en un puñado de pueblos pequeños, así que la ubicación es un dato de alojamiento y no de audiencia.
Todas las páginas abandonadas en menos de dos segundos, visitadas en el orden de tu sitemapUn rastreo recorriendo tus enlacesEstá leyendo, no navegando. No hay tiempo de permanencia ni desplazamiento, y la secuencia sigue tu enlazado interno y no la curiosidad de nadie.

Lo que encontramos al auditar nuestro propio tráfico

Esta parte sale de operar agentceres.com, no de la documentación. Sacamos tres horas de registros de origen en crudo y contamos 1.438 peticiones repartidas entre 558 URL distintas — 2,58 peticiones por URL — y alrededor de tres cuartas partes venían de clientes de centros de datos con user agents falsificados o vacíos. La forma importaba más que el porcentaje: una cola larga de páginas descargadas dos o tres veces cada una es el aspecto que tiene un rastreo, y una audiencia no se parece en nada a eso. Además tenía un precio que sí podíamos ver, porque en su mayoría eran fallos de caché sobre páginas que ninguna persona había pedido, y aparecían como memoria y ancho de banda en la factura de alojamiento en lugar de como lectores.

Una segunda auditoría, esta vez de nuestra analítica y no de los registros, encontró dos distorsiones y solo una era de bots. Nuestro propio equipo navegando por la consola interna de operaciones suponía alrededor del 35% de todas las páginas vistas del sitio: éramos con holgura nuestra mayor audiencia, y nadie se había dado cuenta porque las páginas internas parecen páginas. Después, dentro del tráfico clasificado como Directo, más o menos la mitad no sobrevivió a la inspección: un visitante registrado en cuatro ciudades y cuatro dispositivos en 1,7 segundos, un grupo de sesiones con el campo de ciudad vacío compartiendo un único user agent, y una ventana de 800 píxeles de ancho reportando desde un pueblecito de Oregón más conocido por alojar un gran centro de datos que por comprar software. De cinco fuentes de referencia listadas esa semana, exactamente una era una referencia real.

La corrección no cambió lo que debíamos hacer a continuación; cambió lo que creíamos saber ya, que es peor. Dos cosas arreglaron casi todo y ninguna costó nada. Excluye a tu propio equipo primero, porque es el error más grande y el más fácil de quitar. Después deja de tratar Directo como un canal y empieza a tratarlo como un cajón de visitas que todavía no has identificado: una parte es automatizada, y buena parte del resto es dark social, boca a boca real que llega sin referente. Los dos viven en la misma fila del mismo informe, y separarlos es todo el trabajo.

FAQ

¿El tráfico de bots es malo para el SEO?
En general no. Los rastreadores de búsqueda son bots y los quieres; que te rastreen es la única forma de acabar indexado. Lo que sí puede hacer daño es volumen sin valor: un sitio muy grande donde los rastreadores gastan su tiempo en URL con parámetros, duplicados y callejones sin salida en vez de en tus páginas de verdad, que es el problema del presupuesto de rastreo. En un sitio pequeño, el tráfico de bots es un coste y un problema de medición mucho antes que un problema de posicionamiento.
¿Google Analytics no filtra los bots automáticamente?
Filtra bots y arañas conocidos contra una lista publicada, y esa lista está hecha por definición de clientes que se identifican honestamente. Cualquier cosa que mande un user agent de navegador normal desde un servidor de nube no está en ella y nunca lo estará, porque no hay nada con lo que casar. El filtrado automático elimina la mitad educada del problema.
¿Debería bloquear los rastreadores de IA?
Eso es una decisión de estrategia, no de higiene, y conviene tomarla a conciencia y no por inercia. Bloquear reduce la carga y evita que tu texto alimente un modelo; también te saca de los sistemas que cada vez responden más a las preguntas que hacen tus clientes. Los pros y contras, y qué control gobierna cada comportamiento, están en qué es un rastreador de IA.
¿Por qué mi tráfico Directo es de repente tan alto?
Directo no es una fuente, es la ausencia de una, así que crece por dos motivos que no tienen nada que ver entre sí. Los clientes automatizados llegan sin referente, y también lo hacen las personas reales que pinchan un enlace en un mensaje, un cliente de correo o una comunidad privada. Si Directo sube, sepáralo antes de celebrarlo o descartarlo: mira dark social para la mitad que sí son buenas noticias.
¿Esto significa que mis números de tráfico son falsos?
No. Significa que uno de tus números está respondiendo a una pregunta distinta de la que le estás haciendo. Las sesiones de una etiqueta de JavaScript siguen siendo una aproximación decente a humanos leyendo tus páginas; las peticiones de un registro siguen siendo la verdad sobre carga y rastreo. El problema solo empieza cuando un número de uno se usa para una decisión que le corresponde al otro, que es también el argumento de cómo mido si mi marketing está funcionando.
Related questions
¿Por qué cayó de golpe el tráfico de mi web?¿Por qué mi sitio web no recibe tráfico?¿Cómo mido si mi marketing está funcionando?¿Cómo mido el tráfico que llega desde ChatGPT y otros buscadores con IA?

Want this done for you?

AgentCeres is a managed AI marketing team — specialists draft the work, you approve what ships. 14-day free trial, from $39/month.

Start free trialMore answers