Definición
El rastreo es el proceso por el que un buscador recorre la web descargando páginas. El programa que lo hace se llama rastreador o araña; el de Google es Googlebot.
Funciona de la forma más simple posible: descarga una página, extrae todos los enlaces que encuentra, los añade a una cola, y va repitiendo. Así descubre la web entera.
Es el paso previo a la indexación. Sin rastreo no hay índice, y sin índice no hay resultados. Todo el SEO técnico empieza por asegurarse de que esta parte funciona.
Cómo descubre tus páginas
Por orden de importancia real:
Enlaces desde otras webs. Es como llega la primera vez a un dominio nuevo, y sigue siendo la señal más fuerte.
Enlaces internos. Una vez dentro, salta de página en página. Por eso el enlazado interno no es solo para el usuario: es el mapa por el que Google se mueve.
El sitemap. Una lista explícita de tus URLs. Ayuda especialmente con páginas nuevas o poco enlazadas.
Rastreos anteriores. Vuelve periódicamente a lo que ya conoce, con más frecuencia cuanto más cambia y más importante le parece.
Detalle que importa: Googlebot solo sigue enlaces de verdad, etiquetas <a> con un href. Un <div> con un onclick que navega por JavaScript no es un enlace para él. Una web cuya navegación se construye enteramente con JavaScript puede tener páginas a las que nunca llegue.
Qué lo dificulta
- Páginas huérfanas. Ningún enlace apunta a ellas. Existen y nadie las encuentra.
- Cadenas de redirecciones. Cada salto es una petición más y hay un límite de saltos.
- Errores de servidor. Si tu sitio devuelve errores 5xx, Googlebot reduce el ritmo para no tumbarte. Un servidor lento o inestable se rastrea menos.
- Velocidad. Cuanto más tarda cada página, menos páginas rastrea en el mismo tiempo.
- robots.txt mal puesto.
- Bucles infinitos. Calendarios que generan URLs sin fin, filtros combinables. Se traga el presupuesto de rastreo en páginas inútiles.
Ejemplo práctico
Al auditar una web me encontré con el caso de manual: la portada devolvía un HTML prácticamente vacío porque el contenido se pintaba con JavaScript en el navegador.
Google sí ejecuta JavaScript, pero no en el mismo momento: primero rastrea el HTML y guarda la página en una cola de renderizado para procesarla más tarde. Esa segunda pasada puede tardar días, y tiene presupuesto limitado. Para un blog que publica a diario, eso es una desventaja considerable.
En esta web hice lo contrario a propósito: las 134 páginas del diccionario son HTML de verdad, generadas al compilar. Googlebot descarga la página y ya tiene todo el texto, sin ejecutar nada.
La otra cosa que descubrí midiendo, y que no esperaba: cada carga de página lanzaba entre 11 y 17 peticiones que devolvían 404. Eran ficheros internos de precarga mal nombrados. Para el usuario no se notaba nada. Para un rastreador es ruido: peticiones fallidas que no llevan a ninguna parte y que consumen su tiempo y el de tu servidor. Se arreglaron.
Cómo ver qué rastrea de verdad
Estadísticas de rastreo en Search Console. Te dice cuántas peticiones hace al día, cuánto tarda tu servidor en responder y qué códigos de respuesta recibe. Es el sitio donde se ven los problemas antes de que se noten en el tráfico.
Los registros del servidor. El dato definitivo: qué URLs pidió Googlebot, cuándo y qué le devolviste. Es lo más fiable que existe, y casi nadie lo mira.
Un rastreador propio (Screaming Frog y similares) que recorre tu web como lo haría un buscador y te enseña redirecciones, errores, páginas huérfanas y enlaces rotos.
Errores comunes
- Confundir rastreo con indexación. Que la visite no significa que la guarde.
- Navegación sin enlaces reales. Menús que solo funcionan con JavaScript.
- No mirar los códigos de respuesta. Un sitio lleno de redirecciones encadenadas gasta rastreo en cada salto.
- Servidor lento. Es una de las pocas cosas que hace que Google rastree menos, y afecta a todo el sitio.
- Obsesionarse con el presupuesto de rastreo en una web pequeña. Con doscientas páginas, Google las rastrea todas sin problema. Esto importa a partir de decenas de miles de URLs.
Cuándo preocuparte
Si publicas y tarda semanas en aparecer, si tienes muchas páginas y Search Console dice que solo conoce una fracción, o si el informe de estadísticas muestra tiempos de respuesta altos o muchos errores.
En una web de cien páginas bien enlazadas y rápidas, el rastreo no suele ser tu problema. En una tienda con cien mil URLs, es probablemente el primero.