Solicita hoy tu auditoría SEO gratuita Llama al 91 060 30 90
</>Guía Técnica · 18 min de lectura

Metodología de auditoría técnica con rastreadores

Cada guía de esta sección profundiza en un problema técnico concreto, pero ninguna sustituye la pregunta previa que toda auditoría real necesita responder primero: de todos los problemas posibles, ¿cuáles existen de verdad en este sitio concreto, y con qué gravedad? Esta guía no trata sobre un problema técnico específico, sino sobre el proceso metodológico para encontrarlos todos de forma sistemática con una herramienta de rastreo, en vez de revisar al azar o depender solo de la intuición.

Antes de rastrear: configurar el rastreador para que refleje la realidad

Un rastreo mal configurado genera datos engañosos antes incluso de empezar a analizarlos. La configuración previa debe incluir: el user-agent correcto (rastrear como Googlebot, no como el user-agent por defecto de la herramienta, porque algunos sitios sirven contenido distinto según el user-agent detectado); el respeto o no de robots.txt según lo que se quiera auditar (rastrear ignorando robots.txt temporalmente permite ver qué existe realmente, aunque esté bloqueado, útil para detectar bloqueos accidentales); y el límite de velocidad de rastreo, ajustado para no sobrecargar el servidor de producción durante la auditoría, sobre todo en hosting compartido con recursos limitados.

El primer informe a revisar: códigos de respuesta HTTP

Antes de analizar cualquier otra cosa, conviene tener una visión general de cuántas URLs devuelven cada código de estado (200, 301, 404, 500), como se explica en la guía de redirecciones y códigos HTTP. Un volumen alto de 404 revela enlaces internos rotos o contenido eliminado sin redirección; un volumen alto de 301 en cadena revela migraciones anteriores mal limpiadas; cualquier 500 indica errores de servidor que deben resolverse con la máxima prioridad, porque afectan tanto a usuarios reales como al rastreo de Google.

Resumen típico de un rastreo completo:
200 OK           94.2%
301 Redirect      3.1%
404 Not Found     2.4%
5xx Server Error  0.3%

Un 0.3% de errores 5xx en un sitio de 10.000 URLs
son 30 páginas fallando activamente: prioridad alta.

El segundo informe: duplicados de título y meta descripción

Un rastreador agrupa automáticamente las páginas que comparten el mismo <title> o la misma meta descripción, una señal directa de contenido duplicado o casi duplicado (ver la guía de canonicalización) que en la práctica suele revelar plantillas mal parametrizadas: páginas de producto que heredan el título genérico de la categoría en vez de uno específico, o una meta descripción por defecto que no se sobrescribió al crear el contenido.

El tercer informe: profundidad de clics y enlaces internos

Cruzar la profundidad de clics de cada URL (cuántos clics hacen falta desde la home para llegarla) con el número de enlaces internos entrantes que recibe, como se explica en la guía de arquitectura y enlazado interno, permite identificar rápidamente páginas de alto valor de negocio que están enterradas demasiado profundas en la estructura, candidatas prioritarias para reforzar su enlazado interno.

El cuarto informe: datos estructurados y validación

Un rastreo completo puede extraer y validar automáticamente el JSON-LD presente en cada página, cruzándolo contra las propiedades requeridas por cada tipo de Schema.org (ver la guía de datos estructurados), para detectar de forma masiva páginas con marcado ausente, mal formado, o inconsistente entre sí, algo inviable de revisar manualmente página por página en un sitio de miles de URLs.

El quinto informe: rendimiento agregado

Muchas herramientas de rastreo integran una llamada a la API de PageSpeed Insights por cada URL rastreada, permitiendo ver de un vistazo qué plantillas de página (no solo qué páginas individuales) tienen sistemáticamente peor LCP, INP o CLS, como se explica en la guía de Core Web Vitals. Esto es más eficiente que revisar página por página porque revela patrones: si todas las páginas de producto fallan el mismo umbral, el problema está en la plantilla, no en un producto concreto.

Cómo priorizar los hallazgos: impacto por volumen, no por gravedad aislada

El criterio de priorización que mejor funciona en la práctica no es "qué problema suena más grave en abstracto" sino "qué problema afecta a más páginas de valor real". Un error de canonical mal configurado que afecta a 5.000 páginas de producto es más urgente que un 404 aislado en una página sin tráfico ni enlaces, aunque el segundo "suene" a un fallo más visible. Cruzar cada hallazgo técnico con datos reales de tráfico y de valor de negocio (no solo con el volumen de URLs afectadas) es lo que separa una auditoría útil de una lista genérica de problemas técnicos sin contexto.

Documentar hallazgos con evidencia, no solo con la conclusión

Un hallazgo técnico útil no es "hay contenido duplicado", sino la lista concreta de URLs afectadas, agrupadas y con ejemplos representativos, junto con la causa raíz identificada (una plantilla concreta, una configuración concreta). Esto permite que quien implemente la corrección lo haga sin tener que repetir el proceso de diagnóstico desde cero, y sirve como referencia para verificar después que la corrección funcionó realmente.

Preguntas frecuentes

¿Con qué frecuencia debo repetir una auditoría técnica completa?

Para la mayoría de sitios, una auditoría técnica completa una o dos veces al año es suficiente, complementada con monitorización continua de los informes de Search Console (cobertura, Core Web Vitals, problemas de seguridad) que alertan de problemas nuevos entre auditorías completas.

¿Debo rastrear ignorando robots.txt siempre?

No como configuración por defecto: rastrear respetando robots.txt refleja lo que Google realmente puede ver. Ignorarlo temporalmente es útil solo como comprobación puntual para detectar si algún bloqueo en robots.txt es accidental y está ocultando contenido que debería ser rastreable.

¿Un rastreo detecta también problemas de contenido, no solo técnicos?

Puede aproximar algunos (recuento de palabras, ausencia de H1, títulos demasiado cortos o largos), pero no sustituye una revisión editorial de calidad de contenido, que requiere criterio humano sobre relevancia y utilidad real para el usuario, algo que un rastreador no puede evaluar.

¿Cuántas URLs puedo rastrear sin afectar al rendimiento del servidor en producción?

Depende de la capacidad del hosting, pero como referencia prudente: limitar el rastreo a 1-2 peticiones por segundo evita saturar la mayoría de hostings compartidos, a costa de que la auditoría tarde más en completarse en sitios grandes.

¿Hace falta una herramienta de pago para hacer una auditoría técnica seria?

No necesariamente para sitios pequeños o medianos: varias herramientas de rastreo ofrecen un nivel gratuito con un límite de URLs suficiente para sitios de hasta unos pocos miles de páginas. La necesidad de una versión de pago aparece sobre todo en sitios muy grandes o cuando se necesita automatizar auditorías recurrentes.

¿Hablamos de SEO técnico para tu web?

Cuéntanos tu proyecto y te decimos cómo podemos ayudarte, sin compromiso.

Llama al 91 060 30 90