Calidad
Cómo se comprueba que algo funciona: tests en software, evaluaciones y benchmarks en modelos de IA, criterios de calidad en contenido.
Las tres disciplinas llegaron a la misma conclusión por caminos distintos: sin una forma sistemática de medir si algo ha mejorado o empeorado, cada cambio es una apuesta. Los evals de un modelo son, en el fondo, los tests unitarios de la IA.
Programación9
Que una web pueda usarla cualquiera, con o sin discapacidad. En España es además una obligación legal para muchas empresas.
Conjunto de prácticas que automatizan la integración, prueba y despliegue del software, permitiendo entregar cambios a producción con frecuencia, rapidez y seguridad.
Coste futuro de haber elegido una solución rápida en vez de la correcta. Como una deuda, se puede asumir a propósito, pero genera intereses.
Lo que hay que saber para trabajar en un sistema y no está en el código. Su valor está en el porqué, no en el qué.
Poder entender qué está pasando dentro de un sistema desde fuera, sin tener que añadirle código nuevo cada vez que algo falla.
Reescribir código para que sea más claro o más fácil de mantener sin cambiar en absoluto lo que hace visto desde fuera.
Que otra persona lea un cambio antes de que entre. Sirve más para repartir conocimiento que para cazar errores.
Prueba automática que comprueba una pieza pequeña de código de forma aislada, y que se ejecuta en segundos cada vez que cambias algo.
Extensión de JavaScript que añade tipos comprobados antes de ejecutar, de modo que muchos errores aparecen mientras escribes y no delante del cliente.
Inteligencia Artificial7
Prueba estandarizada que se pasa a muchos modelos para poder compararlos entre sí con la misma vara de medir, como MMLU, HumanEval o SWE-bench.
Datos generados artificialmente que imitan a los reales. Sirven para entrenar y probar sin exponer información de personas.
Batería de casos de prueba con respuesta esperada que mide si un sistema con IA funciona, y sobre todo si un cambio lo ha mejorado o empeorado.
Conjunto de controles que rodean a un modelo para limitar qué entra, qué sale y qué puede ejecutar, de modo que un fallo suyo no se convierta en un problema real.
Fenómeno por el que un LLM genera información que suena coherente y plausible pero es factualmente falsa o inventada, derivado de su naturaleza estadística de predicción de tokens.
Cuando un modelo trata sistemáticamente peor a un grupo. No es un fallo del código: casi siempre estaba ya en los datos.
Fallo por el que un modelo memoriza los datos con los que entrenó, incluido su ruido, y acierta con ellos pero falla al enfrentarse a casos nuevos.
SEO2
Páginas que existen pero no aportan nada al que llega. No es cuestión de longitud: es que no resuelven la búsqueda que las trajo.
Marco de evaluación de calidad de Google basado en Experiencia, Pericia, Autoridad y Confianza, usado por los evaluadores humanos para juzgar la calidad de las páginas.