ENTRENAMIENTO

Aprendizaje por refuerzo

Forma de entrenar en la que un agente aprende probando acciones dentro de un entorno y recibiendo una recompensa o un castigo según el resultado.

Nivel · intermedio4 min de lecturaActualizado 23 ago 2026
También conocido como: Reinforcement learning, RL

Definición

En el aprendizaje por refuerzo nadie le dice al modelo cuál era la respuesta correcta. Se le pone en un entorno, prueba cosas, y recibe una señal numérica —la recompensa— que le indica si lo que hizo estuvo bien o mal. Repitiendo millones de veces, aprende qué comportamiento maximiza esa recompensa a largo plazo.

La diferencia con el aprendizaje supervisado es grande. Allí hay un profesor que corrige cada ejercicio. Aquí solo hay un marcador que sube o baja, y el modelo tiene que deducir solo qué de todo lo que hizo lo movió.

Es la técnica detrás de los sistemas que juegan al Go mejor que cualquier humano, de buena parte de la robótica, y —lo que más nos afecta hoy— del ajuste final de los grandes modelos de lenguaje mediante RLHF.

Cómo funciona

Cinco piezas:

  • Agente: quien decide.
  • Entorno: el mundo donde actúa, real o simulado.
  • Estado: cómo está el mundo ahora mismo.
  • Acción: lo que el agente puede hacer.
  • Recompensa: el número que le llega después de actuar.

El bucle es siempre el mismo: el agente observa el estado, elige una acción según su política, el entorno cambia y le devuelve una recompensa. Con esa información ajusta la política para que la próxima vez elija mejor.

Dos tensiones definen el oficio:

Explorar contra explotar. Si el agente repite siempre lo que ya le funciona, nunca descubrirá algo mejor. Si prueba cosas nuevas todo el rato, no aprovecha lo que sabe. Todo algoritmo de refuerzo gestiona ese equilibrio de alguna manera.

Recompensa diferida. Una jugada de ajedrez no se sabe si fue buena hasta cuarenta movimientos después. Atribuir el mérito a la acción correcta cuando el premio llega tardísimo es el problema difícil de este campo.

Ejemplo práctico

En IMDICA reponemos stock de miles de referencias. La decisión diaria es cuánto pedir de cada una.

Con reglas fijas ("pedir cuando bajes de X, reponer hasta Y") funcionas, pero mal en los extremos: te quedas sin producto cuando hay un pico, o te comes almacén cuando la demanda cae.

En refuerzo el planteamiento sería: el estado es el stock actual, lo que hay pedido al proveedor, la época del año y la demanda reciente. La acción es cuánto pedir. La recompensa premia servir el pedido a tiempo y penaliza tanto la rotura de stock como el capital inmovilizado en el almacén.

Aquí está el detalle que hay que entender antes de emocionarse: eso no se entrena contra la realidad. No puedes dejar que un modelo aprenda a base de dejarte sin stock durante seis meses. Se entrena contra un simulador construido con tu propio histórico, y luego se contrasta. Si el simulador miente, el modelo aprende a jugar bien a un juego que no existe.

Por eso, en una pyme, el aprendizaje por refuerzo casi nunca es la primera herramienta. Un buen modelo de previsión supervisado resuelve el 90 % del problema con una fracción del coste.

Variantes que verás nombradas

  • Q-learning y DQN: el agente aprende a estimar el valor de cada acción en cada estado.
  • Métodos de política (PPO): ajustan directamente la política. PPO es el que se usó para el RLHF de los grandes modelos.
  • RLHF: la recompensa no la da el entorno sino un modelo entrenado con preferencias humanas.
  • DPO: alternativa más simple que se salta el modelo de recompensa.
  • RLVR (refuerzo con recompensa verificable): la recompensa es objetiva —el test pasa o no pasa, el resultado matemático es correcto o no—. Es lo que ha empujado a los modelos de razonamiento.

Errores comunes

  • Diseñar mal la recompensa. El agente optimiza exactamente lo que le pides, no lo que querías pedir. Si premias "pedidos servidos", puede aprender a partir pedidos en trozos para inflar el contador.
  • Confundir simulador con realidad. Todo lo aprendido dentro vale lo que valga el simulador.
  • Usarlo donde bastaba un modelo predictivo. Es la técnica más cara, más lenta y más difícil de depurar de las tres.

Cuándo usarlo

cuando el problema es una secuencia de decisiones donde cada una afecta a las siguientes, cuando puedes simular el entorno con fidelidad razonable, y cuando no existe un histórico de "decisiones correctas" que copiar.

No cuando la decisión es puntual y aislada, cuando no puedes simular sin arriesgar dinero real, o cuando ya tienes histórico etiquetado — ahí el supervisado es más rápido y más barato.

Referencias

Tagsiaentrenamientorefuerzoagentes
Escrito por
Antonio Echeverría

Dirijo IMDICA, una empresa de suministro industrial, desde 2007. Escribo estas definiciones desde el lado de quien las usa para decidir, no desde el de quien las estudia.

Si quieres esto funcionando dentro de tu empresa y no en una demo, lo monto en AE Works.