INTELIGENCIA ARTIFICIAL

Entrenamiento de modelos

Cómo aprende un modelo de IA: datos, parámetros, ajuste fino y todo lo que ocurre antes de que puedas escribirle una pregunta.

Entender esta fase explica casi todas las rarezas de un modelo en producción: por qué inventa, por qué se le da mejor un idioma que otro, por qué su conocimiento tiene fecha de caducidad y por qué dos modelos parecidos responden distinto.

12 términos

Inteligencia Artificial12

Aprendizaje por refuerzo

Forma de entrenar en la que un agente aprende probando acciones dentro de un entorno y recibiendo una recompensa o un castigo según el resultado.

Aprendizaje supervisado

Forma de entrenar un modelo dándole ejemplos con la respuesta correcta ya puesta, para que aprenda a predecirla en casos nuevos que nunca ha visto.

Dataset

Conjunto de datos organizado que se usa para entrenar, validar y evaluar un modelo. Su calidad marca el techo de lo que ese modelo podrá llegar a hacer.

Distillation

Técnica que entrena un modelo pequeño (alumno) para imitar el comportamiento de un modelo grande (profesor), preservando gran parte de su calidad con una fracción del coste.

DPO

Algoritmo de alineamiento que optimiza un modelo directamente sobre preferencias humanas (respuesta A es mejor que B) sin necesidad de entrenar un reward model intermedio.

Fine-tuning

Proceso de tomar un modelo preentrenado y continuar su entrenamiento con datos específicos para adaptarlo a una tarea, dominio o estilo concretos.

Gradient descent

Algoritmo de optimización que ajusta iterativamente los parámetros de un modelo en la dirección opuesta al gradiente del error, hasta encontrar el mínimo que produce las mejores predicciones.

Hiperparámetro

Ajuste que tú decides antes de entrenar y que el modelo no aprende solo: cuántas capas, a qué velocidad aprende, cuántos ejemplos por paso.

LoRA

Técnica de fine-tuning eficiente que adapta modelos grandes entrenando solo pequeñas matrices de baja dimensionalidad, en lugar de modificar los pesos originales del modelo.

Pretraining

Primera fase de creación de un modelo de lenguaje: entrenarlo desde cero con cantidades masivas de texto y un objetivo simple (predecir el siguiente token) durante semanas o meses en miles de GPUs.

RLHF

Técnica de alineamiento donde un modelo de lenguaje se ajusta mediante aprendizaje por refuerzo usando preferencias humanas (qué respuesta es mejor) como señal de recompensa.

Sobreajuste

Fallo por el que un modelo memoriza los datos con los que entrenó, incluido su ruido, y acierta con ellos pero falla al enfrentarse a casos nuevos.