SEO

Presupuesto de rastreo

By Jake Luo · Published 14 ago 2026

El presupuesto de rastreo es la cantidad de URL que un buscador está dispuesto y es capaz de descargar de tu sitio en un periodo dado. Google lo define como el producto de dos cosas — un límite de capacidad de rastreo, lo máximo que puede pedir sin degradar tu servidor, y la demanda de rastreo, cuánto quiere realmente tus páginas — y trata cada nombre de host como si tuviera su propio presupuesto.

Las dos mitades: capacidad y demanda

La capacidad es un techo que Google se pone a sí mismo. Observa con qué rapidez responde tu servidor y con qué frecuencia falla, y se retira cuando el sitio se ralentiza; la idea es rastrearte sin tumbarte. La demanda es la otra mitad: cuánto quiere Google tus URL, según su popularidad y lo desactualizada que esté su copia. Un servidor rápido sin nada que merezca volver a descargarse se rastrea poco igualmente, porque la capacidad nunca fue la limitación.

  • Sube la capacidad — una respuesta rápida y sin errores de forma constante. El ritmo de rastreo sigue la salud del servidor, así que el trabajo de Core Web Vitals y el prerenderizado barato se pagan dos veces.
  • Baja la capacidad — tiempos de espera agotados, errores 5xx y respuestas lentas bajo carga. Un rastreador que empieza a encontrar errores frena y tarda en volver.
  • Sube la demanda — páginas que consiguen tráfico y enlaces, y contenido que cambia de verdad. Los sitemaps y los enlaces internos ayudan a Google a encontrar URL, aunque ser encontrado no es lo mismo que ser deseado.
  • Desperdicia ambas — espacios infinitos de URL como filtros facetados, identificadores de sesión y calendarios sin fin, además de soft 404, cadenas de redirecciones y casi duplicados que deberían haber llevado una etiqueta canónica.

Cuándo es un problema real y cuándo es una distracción

La propia guía de Google es inusualmente clara sobre a quién le importa. Su documento sobre presupuesto de rastreo para sitios grandes nombra tres públicos: sitios con más de un millón de URL únicas cuyo contenido cambia más o menos cada semana, sitios con más de diez mil URL únicas cuyo contenido cambia a diario, y sitios en los que Search Console clasifica una parte importante de las URL como *Detectada: actualmente sin indexar*. Si no encajas en ninguno, Google dice que basta con mantener el sitemap al día y vigilar el informe de indexación de páginas.

El tercer público es el útil, porque es un síntoma y no un tamaño. También conviene separar rastreo de indexación: Google es explícito en que no toda página rastreada acaba indexada. Una URL en *Rastreada: actualmente sin indexar* no se quedó sin presupuesto de rastreo — fue descargada, evaluada y descartada, lo cual es un problema de contenido o duplicación, no de ancho de banda. Confundirlo es la forma más común de aplicar mal el término, y lleva a fundadores a retocar robots.txt cuando lo que deberían hacer es consolidar páginas flojas.

Qué aspecto tiene el tráfico de rastreo en un sitio de cola larga

Podemos poner números a esto desde nuestros propios registros, y nos sorprendieron. Nuestro sitio de marketing prerenderiza unas tres mil páginas en ocho idiomas, justo en el rango en el que los fundadores empiezan a preocuparse. En una muestra de tres horas de peticiones al origen contamos 1.438 descargas repartidas entre 558 URL distintas: unas 2,6 por URL y, para la mayoría, la única visita que recibieron.

El segundo hallazgo importó más. Alrededor de tres cuartas partes de ese tráfico no era un buscador, sino scrapers de centros de datos con user agents falsos o vacíos. A los rastreadores de IA con nombre propio los dejamos pasar a propósito, porque que te lean es justamente el objetivo de la optimización para motores generativos. De ahí dos consecuencias prácticas: lo que parece presión de rastreo casi nunca es el rastreador que te interesa, y una caché CDN de vida corta aporta poquísimo a un catálogo de cola larga, porque cada URL se pide demasiado poco como para seguir caliente en la siguiente pasada. Si quieres vigilar la mitad que sí es del buscador, un monitor autoalojado como CrawlSEO lo lee directamente de Search Console.

FAQ

¿Tengo que preocuparme por el presupuesto de rastreo en un sitio pequeño?
Casi con seguridad no. Google dirige este trabajo a sitios por encima de unas diez mil páginas que cambian a diario, o un millón que cambian semanalmente; por debajo, su consejo es mantener el sitemap correcto, corregir los errores de servidor y dedicar el tiempo al contenido. La única excepción es la prueba del síntoma, no la del tamaño: si Search Console marca una parte importante de tus URL como Detectada: actualmente sin indexar, míralo sea cual sea tu número de páginas.
¿Bloquear páginas en robots.txt ahorra presupuesto de rastreo?
Ahorra la descarga, pero es un instrumento tosco y no saca la URL del índice si otras páginas la enlazan: una URL bloqueada puede seguir apareciendo como un enlace pelado sin descripción. Úsalo para espacios de URL que de verdad no valen nada, como combinaciones de filtros facetados y resultados de búsqueda interna. Para duplicados que deben consolidarse, la herramienta correcta es la etiqueta canónica; para páginas que quieres fuera del índice, lo es noindex, y noindex solo funciona si el rastreador aún puede descargar la página y verlo.
Related terms
Enlazado internoEtiqueta canónicaCore Web VitalsSEO programático (pSEO)

An AI growth team that runs this for you

AgentCeres is a managed AI marketing team — you approve what ships. 14-day free trial, from $39/month.

Start free trialBrowse the glossary