Calidad
Cómo se comprueba que algo funciona: tests en software, evaluaciones y benchmarks en modelos de IA, criterios de calidad en contenido.
Las tres disciplinas llegaron a la misma conclusión por caminos distintos: sin una forma sistemática de medir si algo ha mejorado o empeorado, cada cambio es una apuesta. Los evals de un modelo son, en el fondo, los tests unitarios de la IA.
Inteligencia Artificial5
Prueba estandarizada que se pasa a muchos modelos para poder compararlos entre sí con la misma vara de medir, como MMLU, HumanEval o SWE-bench.
Batería de casos de prueba con respuesta esperada que mide si un sistema con IA funciona, y sobre todo si un cambio lo ha mejorado o empeorado.
Conjunto de controles que rodean a un modelo para limitar qué entra, qué sale y qué puede ejecutar, de modo que un fallo suyo no se convierta en un problema real.
Fenómeno por el que un LLM genera información que suena coherente y plausible pero es factualmente falsa o inventada, derivado de su naturaleza estadística de predicción de tokens.
Fallo por el que un modelo memoriza los datos con los que entrenó, incluido su ruido, y acierta con ellos pero falla al enfrentarse a casos nuevos.
Programación5
Conjunto de prácticas que automatizan la integración, prueba y despliegue del software, permitiendo entregar cambios a producción con frecuencia, rapidez y seguridad.
Coste futuro de haber elegido una solución rápida en vez de la correcta. Como una deuda, se puede asumir a propósito, pero genera intereses.
Reescribir código para que sea más claro o más fácil de mantener sin cambiar en absoluto lo que hace visto desde fuera.
Prueba automática que comprueba una pieza pequeña de código de forma aislada, y que se ejecuta en segundos cada vez que cambias algo.
Extensión de JavaScript que añade tipos comprobados antes de ejecutar, de modo que muchos errores aparecen mientras escribes y no delante del cliente.