GENERACION

Temperatura

Ajuste que controla cuánto azar mete un modelo al elegir la siguiente palabra: baja lo vuelve predecible y repetitivo, alta lo vuelve creativo y errático.

Nivel · principiante4 min de lecturaActualizado 23 ago 2026
También conocido como: Temperature, Temperatura de muestreo

Definición

La temperatura es el ajuste que decide cuánto azar mete el modelo al elegir cada palabra. Es el mando más simple que tienes para mover una respuesta entre "aburrida y fiable" y "creativa e imprevisible".

Un LLM no elige un token concreto: calcula una probabilidad para cada uno de los posibles y luego muestrea de esa distribución. La temperatura aplasta o exagera esas probabilidades antes de tirar el dado.

  • Temperatura 0: siempre el token más probable. Salida prácticamente determinista.
  • Temperatura 1: se respeta la distribución tal cual la calculó el modelo.
  • Temperatura 2: se aplanan las diferencias, los tokens improbables ganan opciones y la salida se vuelve rara.

Cómo funciona

Antes de convertir las puntuaciones brutas en probabilidades, cada una se divide por la temperatura T.

Si T es pequeña (0,2), las diferencias se agrandan: lo que era 60 % frente a 20 % pasa a ser casi 99 % frente a 1 %. El modelo va casi siempre a lo seguro.

Si T es grande (1,5), las diferencias se achican: aquel 60/20 se acerca a un 40/30. Opciones que casi nunca saldrían empiezan a salir.

Conviene saber una cosa: temperatura 0 no garantiza salidas idénticas. Sobre hardware paralelo hay pequeñas variaciones de coma flotante que a veces cambian cuál era el token más probable por márgenes mínimos. Se acerca mucho al determinismo, pero no lo firma.

Temperatura y top-p no son lo mismo

Se confunden constantemente. Top-p (nucleus sampling) recorta primero la lista: se queda solo con los tokens que suman el p % de probabilidad y descarta la cola. La temperatura reparte el azar; top-p decide entre cuántos candidatos se reparte.

Se pueden usar juntos, pero lo habitual y sensato es mover uno solo y dejar el otro en su valor por defecto.

Ejemplo práctico

En el CRM de IMDICA usamos modelos de lenguaje para dos cosas muy distintas, y cada una pide un valor opuesto.

Clasificar un movimiento bancario en su categoría de gasto. Aquí no quiero ninguna creatividad: quiero que el mismo concepto dé siempre la misma categoría, hoy y dentro de tres meses, porque de eso salen los informes. Temperatura 0. Si el modelo un día decide que "SUMINISTROS IND SL" es material y otro día consumibles, los números del trimestre dejan de cuadrar y nadie sabe por qué.

Redactar el borrador de un email comercial. Aquí quiero variedad: si mando cuarenta correos con la misma frase de apertura, se nota que es una plantilla. Temperatura 0,7-0,9. El borrador lo revisa una persona antes de enviarlo, así que el riesgo de una frase rara es bajo y el beneficio de que suene humano es alto.

La regla que sacamos: si la salida alimenta un sistema, temperatura baja. Si la lee una persona que puede corregirla, temperatura media.

Qué valor usar

  • 0 a 0,2 — Clasificación, extracción de datos, respuestas a partir de documentos, generación de código, cualquier cosa que otro sistema vaya a parsear.
  • 0,3 a 0,7 — Resúmenes, respuestas de asistente, redacción con margen pero controlada.
  • 0,8 a 1,2 — Escritura creativa, lluvia de ideas, generar variantes de un texto.
  • Por encima de 1,3 — Casi siempre un error. La salida se degrada rápido.

Errores comunes

  • Subir la temperatura para arreglar respuestas malas. Si el modelo se equivoca, el problema es el prompt o el contexto, no la falta de azar. Subir temperatura le da más formas de equivocarse, no más aciertos.
  • Usar temperatura alta con salida estructurada. Si esperas un JSON y pones 0,9, tarde o temprano te devuelve algo que no parsea.
  • Creer que baja temperatura evita alucinaciones. Reduce la variabilidad, no la falsedad: un modelo puede inventarse un dato con total seguridad a temperatura 0.
  • Mover temperatura y top-p a la vez. Acabas sin saber cuál de los dos causó el cambio.

Cuándo tocarla

Déjala en el valor por defecto mientras no tengas un motivo concreto. Cuando lo tengas, muévela en una dirección y comparando la misma tanda de ejemplos, no a ojo con una prueba suelta.

Y si tu aplicación tiene los dos casos —clasificar y redactar—, configura la temperatura por llamada, no globalmente.

Referencias

Tagsiageneraciónllmparámetros
Escrito por
Antonio Echeverría

Dirijo IMDICA, una empresa de suministro industrial, desde 2007. Escribo estas definiciones desde el lado de quien las usa para decidir, no desde el de quien las estudia.

Si quieres esto funcionando dentro de tu empresa y no en una demo, lo monto en AE Works.