Se habla mucho del "presupuesto de rastreo" en SEO, casi siempre con un tono de alarma. La realidad es más tranquila: para la mayoría de webs de negocio no es un problema. Pero cuando sí lo es, puede explicar por qué páginas importantes tardan semanas en aparecer en Google.
Vamos a ver qué es exactamente, a quién afecta y qué hacer para no malgastarlo.
Qué es el presupuesto de rastreo
Es la cantidad de URLs que Googlebot (el robot de Google) puede y quiere visitar en tu sitio en un periodo de tiempo. Según la documentación de Google, depende de dos factores. El primero es el límite de capacidad: cuántas peticiones puede hacer sin saturar tu servidor; si el servidor responde lento o devuelve errores 5xx, Google reduce el ritmo. El segundo es la demanda de rastreo: cuánto interés tiene Google en tus URLs, según su popularidad y la frecuencia con que cambian.
No confundas rastrear con indexar. Rastrear es que Googlebot visite la página; indexar es que la guarde para poder mostrarla en resultados. Una página puede rastrearse y no indexarse, y eso casi nunca tiene que ver con el presupuesto.
A qué webs afecta de verdad (y a cuáles no)
La propia Google dirige su guía de presupuesto de rastreo a sitios grandes: los que tienen más de un millón de páginas únicas cuyo contenido cambia con cierta frecuencia, o más de 10.000 páginas con cambios muy rápidos (diarios). También menciona los sitios con muchas URLs en el estado "Descubierta: actualmente sin indexar" de Search Console.
Si tienes una web corporativa de treinta páginas, un blog o incluso una tienda de unos cientos de productos, lo normal es que el presupuesto no sea tu cuello de botella. Si una página tuya no se indexa, busca antes la causa en la calidad del contenido, el enlazado interno o un error técnico. Donde sí aparece el problema, incluso con catálogos medianos, es en tiendas cuyos filtros generan miles de combinaciones de URL.
Qué lo desperdicia
Googlebot gasta peticiones en cualquier URL que encuentre, sea útil o no. Los culpables más habituales son:
- URLs duplicadas: parámetros de seguimiento y sesión, http y https, con y sin www.
- Navegación por facetas y filtros: talla, color y precio combinados pueden producir miles de URLs casi idénticas.
- Espacios infinitos: calendarios con "mes siguiente" sin fin o resultados del buscador interno.
- Redirecciones en cadena (A lleva a B, B a C, C a D). Googlebot sigue hasta 10 saltos, pero cada salto es una petición más.
- Errores: muchos enlaces internos que dan 404, páginas "no encontradas" que devuelven código 200 (soft 404) o fallos 5xx.
- Un sitemap lleno de URLs que redirigen, dan error o están marcadas como noindex.
Cómo mejorarlo
Ordenados de mayor a menor impacto habitual:
- Enlaza siempre a la URL final. Los enlaces internos y el sitemap deben apuntar a una dirección que responda 200, sin pasar por redirecciones.
- Acorta las cadenas de redirecciones para que cada URL antigua salte directamente al destino definitivo.
- Controla los filtros y los duplicados. Con robots.txt puedes impedir que se rastreen secciones enteras; con noindex o canonical evitas que se indexen, pero Google tiene que rastrear la página para ver esas instrucciones. Y no combines ambos: si bloqueas una URL en robots.txt, Google nunca verá su noindex.
- Mejora la velocidad y estabilidad del servidor. Un servidor rápido permite más peticiones.
- Mantén el sitemap limpio, solo con URLs indexables, y con fechas de modificación fiables.
- Elimina o devuelve 404/410 en el contenido inútil que no vas a recuperar.
Cómo comprobar dónde se va el rastreo
En Search Console, dentro de Configuración, el informe de Estadísticas de rastreo muestra las solicitudes por día, el tiempo medio de respuesta y el desglose por código de respuesta y por tipo de archivo. Si ves un porcentaje alto de 404, redirecciones o parámetros extraños, ahí tienes una pista.
Para ir más a fondo están los registros (logs) del servidor, que muestran qué URLs pide realmente Googlebot. Si Google dedica la mayor parte de sus visitas a URLs de filtros que no te interesan, ya sabes dónde actuar. Un rastreador SEO de escritorio también te ayuda a ver tu sitio como lo ve un robot.
Preguntas frecuentes
¿Puedo pedirle a Google que rastree más mi web?
No existe un ajuste para subir el presupuesto. Lo que sí puedes hacer es mejorar los dos factores: un servidor rápido y estable, contenido que merezca la pena y buen enlazado interno. Solicitar la indexación en Search Console sirve para URLs concretas, no para aumentar el rastreo.
¿Mi web nueva tiene poco presupuesto de rastreo?
Es normal que Google tarde en descubrir y visitar un sitio nuevo, porque aún no lo conoce ni hay enlaces que apunten a él. No es un problema de presupuesto, sino de descubrimiento: ayuda enviar un sitemap y conseguir algunos enlaces externos.
¿Bloquear páginas en robots.txt libera presupuesto para las demás?
Reduce las peticiones a esas URLs, pero no hay garantía de que Google reasigne ese rastreo a otras páginas tuyas, salvo que estuvieras llegando al límite de capacidad de tu servidor. Úsalo para evitar rastrear lo que no aporta, no como truco para acelerar el resto.