Rastreo vs Indexación
Son dos fases distintas y consecutivas, y confundirlas lleva a diagnósticos equivocados: se bloquea el rastreo creyendo que se evita la indexación, y se consigue justo lo contrario.
Google visita y lee la página
Google la guarda en su índice y puede mostrarla
Rastrear es visitar y leer. Indexar es decidir que merece la pena guardarla y poder mostrarla en resultados. Google rastrea muchísimo más de lo que indexa: una página puede visitarse cien veces y no entrar nunca en el índice porque se considera duplicada, de poco valor o redundante. El rastreo es condición necesaria, no suficiente.
| Dimensión | Rastreo | Indexación |
|---|---|---|
| Qué hace Google | Visita y descarga la página | La analiza y decide guardarla |
| Se controla con | robots.txt, enlaces internos, sitemap | Etiqueta noindex, canonical, calidad |
| Consume presupuesto de rastreo | Sí | No directamente |
| Se puede rastrear sin lo otro | Sí, es lo habitual | No: sin rastreo no hay indexación normal |
| Dónde se comprueba | Estadísticas de rastreo en Search Console | Informe de cobertura |
| Frecuencia | Continua, según la importancia del sitio | Puntual: se decide y se revisa |
| Síntoma típico de fallo | Páginas nuevas que tardan semanas en aparecer | «Rastreada, actualmente sin indexar» |
Se trabaja el rastreo cuando Google no llega a páginas que sí quieres: enlazado interno pobre, sitemap incompleto, arquitectura demasiado profunda o presupuesto de rastreo malgastado en URLs inútiles.
Se trabaja la indexación cuando Google llega pero no guarda: contenido fino, duplicados, canonical mal puesto o simplemente páginas que no aportan nada nuevo.
Bloquear una URL en robots.txt para sacarla de Google. Al bloquear el rastreo, Google deja de poder leer la página — y por tanto deja de ver la etiqueta noindex que sí la habría sacado. La URL puede seguir apareciendo en resultados, sin descripción, indefinidamente. Para desindexar hay que permitir el rastreo y usar noindex. El otro error frecuente es el contrario: dar por hecho que si Search Console dice que una URL fue rastreada ya está posicionando. Rastreada, indexada y posicionada son tres estados distintos, y entre el segundo y el tercero está todo el trabajo de contenido.