Orçamento de rastreamento
Orçamento de rastreamento é quantas URLs um buscador está disposto e é capaz de baixar do seu site em um dado período. O Google o define como o produto de duas coisas — um limite de capacidade de rastreamento, o máximo que ele consegue buscar sem degradar o seu servidor, e a demanda de rastreamento, o quanto ele realmente quer as suas páginas — e trata cada nome de host como tendo o próprio orçamento.
As duas metades: capacidade e demanda
Capacidade é um teto que o Google impõe a si mesmo. Ele observa a rapidez com que o seu servidor responde e com que frequência ele falha, e recua quando o site fica lento; a ideia é rastrear você sem derrubar você. Demanda é a outra metade: o quanto o Google quer as suas URLs, conforme a popularidade delas e o quanto a cópia dele envelheceu. Um servidor rápido sem nada que valha rebuscar continua sendo rastreado pouco, porque a capacidade nunca foi a restrição.
- Aumenta a capacidade — uma resposta consistentemente rápida e sem erros. A taxa de rastreamento acompanha a saúde do servidor, então trabalho de Core Web Vitals e pré-renderização barata se pagam duas vezes.
- Reduz a capacidade — tempos limite, erros 5xx e respostas lentas sob carga. Um rastreador que começa a encontrar erros desacelera e demora a voltar ao normal.
- Aumenta a demanda — páginas que conquistam tráfego e links, e conteúdo que muda de verdade. Sitemaps e links internos ajudam o Google a encontrar URLs, embora ser encontrado não seja o mesmo que ser desejado.
- Desperdiça as duas — espaços infinitos de URL como filtros facetados, ids de sessão e calendários sem fim, além de soft 404, cadeias de redirecionamento e quase-duplicatas que deveriam ter uma tag canônica.
Quando é um problema real e quando é distração
A própria orientação do Google é incomumente direta sobre quem deve se importar. O guia dele sobre orçamento de rastreamento para sites grandes cita três públicos: sites com mais de um milhão de URLs únicas cujo conteúdo muda mais ou menos toda semana, sites com mais de dez mil URLs únicas cujo conteúdo muda diariamente, e sites em que o Search Console classifica boa parte das URLs como *Detectada: não indexada no momento*. Se você não se encaixa em nenhum, o Google diz que manter o sitemap atualizado e acompanhar o relatório de indexação de páginas é suficiente.
O terceiro público é o útil, porque é um sintoma e não um tamanho. Também vale separar rastreamento de indexação: o Google é explícito ao dizer que nem toda página rastreada será indexada. Uma URL parada em *Rastreada: não indexada no momento* não ficou sem orçamento de rastreamento — ela foi baixada, avaliada e preterida, o que é um problema de conteúdo ou duplicação, não de banda. Confundir os dois é a maneira mais comum de aplicar mal o termo, e leva fundadores a mexer no robots.txt quando deveriam estar consolidando páginas fracas.
Como o tráfego de rastreamento realmente se parece em um site de cauda longa
Conseguimos colocar números nisso a partir dos nossos próprios logs, e eles nos surpreenderam. O nosso site de marketing pré-renderiza cerca de três mil páginas em oito idiomas, bem na faixa em que fundadores começam a se preocupar. Em uma amostra de três horas de requisições à origem, contamos 1.438 buscas espalhadas por 558 URLs distintas: cerca de 2,6 por URL e, para a maioria, a única visita que receberam.
O segundo achado importou mais. Cerca de três quartos desse tráfego não era buscador algum, e sim scrapers de datacenter com user agents falsificados ou vazios. Os rastreadores de IA com nome próprio nós deixamos passar de propósito, porque ser lido é exatamente o objetivo da otimização para motores generativos. Duas consequências práticas: o que parece pressão de rastreamento quase nunca é o rastreador que você quer agradar, e um cache de CDN de vida curta rende pouquíssimo num acervo de cauda longa, porque cada URL é pedida rara demais para continuar quente na passada seguinte. Se quiser observar a metade que é buscador, um monitor auto-hospedado como o CrawlSEO lê isso direto do Search Console.
FAQ
- Preciso me preocupar com orçamento de rastreamento em um site pequeno?
- Quase certamente não. O Google direciona esse trabalho a sites acima de cerca de dez mil páginas que mudam diariamente, ou um milhão que mudam por semana; abaixo disso, o conselho dele é manter o sitemap correto, corrigir erros de servidor e gastar o tempo com conteúdo. A única exceção é o teste do sintoma, não o do tamanho: se o Search Console mostrar boa parte das suas URLs como Detectada: não indexada no momento, investigue independentemente da contagem de páginas.
- Bloquear páginas no robots.txt economiza orçamento de rastreamento?
- Economiza a busca, mas é um instrumento grosseiro e não tira a URL do índice se outras páginas apontam para ela: uma URL bloqueada ainda pode aparecer como um link seco, sem descrição. Use para espaços de URL realmente sem valor, como combinações de filtros facetados e resultados de busca interna. Para duplicatas que deveriam consolidar, a ferramenta certa é a tag canônica; para páginas que você quer fora do índice, é o noindex, e o noindex só funciona se o rastreador ainda puder baixar a página e enxergá-lo.
An AI growth team that runs this for you
AgentCeres is a managed AI marketing team — you approve what ships. 14-day free trial, from $39/month.