TECNICO

robots.txt

Fichero en la raíz del dominio que le dice a los rastreadores qué partes del sitio pueden recorrer. Controla el rastreo, no la indexación.

Nivel · principiante4 min de lecturaActualizado 23 ago 2026
También conocido como: Fichero robots, Protocolo de exclusión de robots

Definición

El robots.txt es un fichero de texto que vive siempre en la raíz del dominio (tudominio.com/robots.txt) y le indica a los rastreadores qué partes del sitio pueden recorrer y cuáles no.

Es un protocolo de cortesía, no un mecanismo de seguridad. Los rastreadores serios lo respetan; un robot malicioso lo ignora sin más. De hecho, publicar ahí la ruta de tu zona privada es enseñársela a todo el mundo.

Y aquí está el malentendido que causa la mitad de los problemas de SEO técnico: robots.txt controla el rastreo, no la indexación. Son dos cosas distintas.

Rastrear no es indexar

  • Rastrear es que Google visite la página y lea su contenido.
  • Indexar es que Google la guarde en su índice y pueda mostrarla en los resultados.

Si bloqueas una página en robots.txt, Google no la visita. Pero si alguien la enlaza desde otro sitio, Google sabe que existe y puede indexarla igual, mostrándola sin descripción, con el texto "no hay información disponible sobre esta página".

La consecuencia práctica es contraintuitiva: para sacar una página de Google, bloquearla en robots.txt es exactamente lo contrario de lo que hay que hacer. Si la bloqueas, Google no puede entrar a leer la etiqueta noindex que le diría que la quite. Se queda ahí, en un limbo.

Para desindexar: deja que la rastree y ponle noindex. Cuando ya haya desaparecido, entonces sí puedes bloquearla si quieres ahorrar rastreo.

Cómo se escribe

User-agent: *
Allow: /
Disallow: /panel/
Disallow: /carrito/
Disallow: /*?orden=

Sitemap: https://tudominio.com/sitemap.xml
  • User-agent — a qué rastreador aplica. * es todos.
  • Disallow — qué rutas no debe recorrer.
  • Allow — excepción dentro de un bloqueo.
  • Sitemap — dónde está tu sitemap. Conviene ponerlo siempre.

Las reglas se aplican por prefijo, admiten * como comodín y $ para indicar final de ruta.

Ejemplo práctico

Al auditar una web me encontré con esto en su robots.txt:

Disallow: /dist/

La carpeta /dist/ era donde vivían todo el JavaScript y todo el CSS compilados de la web. Bloqueada.

El efecto es demoledor y no es evidente: Google renderiza las páginas como lo haría un navegador, y si no puede descargar el CSS ni el JavaScript, ve una página rota. En un sitio que además pintaba el contenido con JavaScript, lo que Google veía era prácticamente una página en blanco.

Nadie lo había puesto con mala intención: alguien quiso "que no indexara ficheros técnicos". Pero Google no indexa un fichero CSS de todos modos; solo lo necesita para entender la página.

La regla que saco: nunca bloquees los recursos que la página necesita para verse. CSS, JavaScript e imágenes tienen que ser accesibles.

En mi caso, el robots.txt de esta web es de tres líneas: permite todo, bloquea las dos rutas privadas y apunta al sitemap. Cuanto más corto, menos formas hay de equivocarse.

Errores comunes

  • Disallow: / en producción. Es el error catastrófico: bloquea el sitio entero. Suele llegar por copiar el robots.txt del entorno de pruebas, donde sí tenía sentido. Si tu tráfico orgánico cae a plomo de un día para otro, mira esto lo primero.
  • Bloquear CSS y JavaScript. Google ve la web rota.
  • Usarlo para ocultar contenido privado. Es un fichero público. Estás dando un índice de dónde mirar.
  • Creer que quita páginas del índice. No las quita. A veces las deja peor.
  • Olvidar que es por dominio y por protocolo. El de http:// y el de https:// son ficheros distintos, igual que el de un subdominio.
  • No comprobarlo tras una migración. Es de las primeras cosas que hay que verificar al lanzar.

Cuándo tocarlo

Al lanzar cualquier web, para asegurarte de que no bloquea nada importante y de que apunta al sitemap.

Y para ahorrar presupuesto de rastreo en sitios grandes: bloquear filtros de catálogo con parámetros infinitos, resultados de búsqueda interna o versiones de impresión evita que Google gaste su tiempo en páginas que no aportan nada.

En una web pequeña, el robots.txt casi nunca es lo que hay que optimizar. En una tienda con cien mil URLs de filtros, sí.

Referencias

Tagsseotécnicorastreofundamentos
Escrito por
Antonio Echeverría

Dirijo IMDICA, una empresa de suministro industrial, desde 2007. Escribo estas definiciones desde el lado de quien las usa para decidir, no desde el de quien las estudia.

Si esto que acabas de leer es un problema en tu web, lo arreglo desde AE Works.