Un cliente entra en la categoría de zapatillas, marca «negro», luego «talla 42» y por último ordena «de menor a mayor precio». Para él es una sola búsqueda. Para el servidor es una URL nueva con tres parámetros, casi idéntica a otra que ya existía. Multiplica eso por cada categoría, color, talla y orden posible, y una tienda de unos cientos de productos puede acabar exponiendo decenas de miles de direcciones.
Google no sabe de entrada cuáles de esas URLs importan. Si no se lo indicas tú, decide por su cuenta, y es habitual que gaste tiempo en páginas que no te aportan nada mientras tarda más en revisar las que sí venden. Vamos a ver qué ocurre exactamente y cómo ponerle orden.
Cómo nace una avalancha de URLs a partir de un solo listado
Los parámetros son la parte de la dirección que aparece tras el signo de interrogación, por ejemplo ?color=negro&talla=42&orden=precio. Cada combinación distinta es, para un buscador, una URL distinta. Y el problema se agrava porque el orden de los parámetros también cuenta: ?color=negro&talla=42 y ?talla=42&color=negro muestran lo mismo pero son dos direcciones.
Conviene distinguir tres tipos. Las facetas (color, marca, material) filtran y cambian de verdad qué productos se ven. La ordenación (precio, novedades) solo reordena los mismos productos. Y los parámetros de seguimiento o de sesión (campañas, identificadores) no cambian nada del contenido. Cada tipo merece un tratamiento distinto.
Qué problemas causan realmente
El primero es el rastreo desperdiciado: Googlebot dedica un tiempo limitado a cada sitio, y si gran parte se va en variantes de filtros, las páginas importantes se revisan con menos frecuencia. En tiendas pequeñas rara vez es grave; en catálogos grandes, sí lo es.
El segundo son los duplicados: la misma lista de productos aparece en muchas URLs y Google tiene que elegir una como canónica, que puede no ser la que tú quieres. El tercero es la canibalización: una URL filtrada compite con tu categoría principal por la misma búsqueda, y los enlaces y señales se reparten entre las dos en lugar de sumarse.
Las herramientas de control y para qué sirve cada una
No son intercambiables, y mezclarlas mal es el error más común:
- Canonical (
rel="canonical"): indica cuál es la versión preferida. Es una pista, no una orden, y las URLs siguen pudiendo rastrearse. Va bien para ordenaciones y parámetros de seguimiento, que deben apuntar a la URL limpia. - noindex (etiqueta
meta robotso cabeceraX-Robots-Tag): pide que la página no aparezca en los resultados. Google tiene que poder rastrearla para leerlo. - robots.txt: impide que se rastreen ciertas rutas y ahorra recursos, pero no es una orden de desindexar. Una URL bloqueada que recibe enlaces puede seguir apareciendo en Google sin contenido, y Google no verá ningún canonical ni noindex que pongas dentro.
- Enlaces no rastreables: si los filtros se aplican con botones o formularios en lugar de enlaces normales, el buscador ni los descubre.
Por eso no se combinan robots.txt y noindex sobre la misma URL: si bloqueas el rastreo, el noindex no se lee nunca.
Qué facetas sí merece la pena indexar
Algunas combinaciones coinciden con búsquedas reales: «zapatillas running mujer», «sofás de piel» o «vestidos de fiesta largos». Esas páginas pueden posicionar muy bien porque responden justo a lo que la gente teclea. Una faceta merece indexarse si cumple varias condiciones: hay demanda comprobable (puedes verla en Search Console o en una herramienta de palabras clave), tiene suficientes productos, usa una URL limpia y estable, lleva su propio título, encabezado y texto, y recibe un enlace desde la categoría o el menú.
La regla práctica es sencilla: si podrías defenderla como una categoría propia, indexa. Las demás (talla, precio, orden, combinaciones de tres o más filtros) conviene dejarlas fuera del índice y, si es posible, fuera del rastreo.
Cómo comprobar cómo está hoy tu tienda
En Search Console, el informe de Páginas te permite buscar URLs con interrogación y ver estados como «Duplicada: Google ha elegido una URL canónica distinta a la del usuario». Las Estadísticas de rastreo (en Ajustes) muestran qué proporción de peticiones va a URLs con parámetros. Y a mano puedes abrir una URL filtrada, ver el código fuente y comprobar qué canonical y qué meta robots lleva.
Un detalle útil: Google retiró en 2022 la antigua herramienta de parámetros de URL de Search Console, así que ya no se puede configurar desde ahí; todo se resuelve en tu propia web.
Preguntas frecuentes
¿Basta con poner canonical en todas las URLs filtradas?
No siempre. Ayuda a consolidar señales, pero Google puede ignorarlo si las páginas son muy distintas entre sí, y no impide que se sigan rastreando. En catálogos grandes se combina con enlaces no rastreables o con reglas en robots.txt.
¿Puedo bloquear todos los parámetros en robots.txt?
Con mucho cuidado. Puedes bloquear sin querer facetas que sí quieres posicionar o parámetros que la web usa para cargar contenido. Prueba las reglas con ejemplos reales antes de publicarlas.
Mi tienda es pequeña, ¿necesito hacer todo esto?
Probablemente no a ese nivel. Aun así conviene asegurarse de que la ordenación y los parámetros de seguimiento apuntan con canonical a la URL limpia y de que ningún filtro absurdo se indexa. Es poco trabajo y evita problemas cuando el catálogo crezca.