ENTRENAMIENTO

Datos sintéticos

Datos generados artificialmente que imitan a los reales. Sirven para entrenar y probar sin exponer información de personas.

Nivel · intermedio4 min de lecturaActualizado 27 ago 2026
También conocido como: Synthetic data, Datos generados, Datos artificiales

Definición

Los datos sintéticos son datos generados artificialmente que imitan las propiedades estadísticas de unos datos reales, sin ser ninguno de ellos.

No es lo mismo que anonimizar. Anonimizar parte de datos reales y les quita los identificadores —y de ahí que a veces se pueda revertir cruzando fuentes. Sintetizar produce registros que no corresponden a nadie: se aprende la forma de los datos y se generan ejemplos nuevos con esa forma.

Para qué se usan

Para no exponer datos personales. Es el uso más claro: desarrollar y probar sin sacar de producción los datos de clientes reales. Ver también el RGPD.

Para rellenar lo que falta. Si tienes 10.000 casos normales y 30 de fraude, un modelo aprenderá a decir «no es fraude» siempre. Generar casos raros equilibra el entrenamiento.

Para probar lo que aún no ha pasado. Simular un pico de pedidos, una avería en cascada o un cliente con un comportamiento extremo, sin esperar a que ocurra.

Para entrenar modelos con instrucciones. Buena parte del ajuste de los LLM actuales usa ejemplos generados por otros modelos y filtrados después por humanos.

El riesgo grande: el colapso del modelo

Es el fenómeno que más conviene conocer, y el más contraintuitivo.

Si entrenas un modelo con datos generados por otro modelo, y luego otro con los de ese, y así sucesivamente, la calidad se degrada generación tras generación. Los casos raros van desapareciendo, la variedad se estrecha y el resultado converge hacia lo más común y anodino.

La imagen que lo explica: es como fotocopiar una fotocopia. Cada pasada parece aceptable; a la décima no queda nada del original.

Por eso la regla práctica: los datos sintéticos complementan a los reales, no los sustituyen. En cuanto los reales desaparecen del bucle, empieza la degradación.

Ejemplo práctico

En una pyme el uso más inmediato no es entrenar nada: es poder trabajar sin tocar datos de clientes.

Cuando hay que probar una migración, enseñar el sistema a alguien nuevo o desarrollar una función que toca facturación, lo cómodo es usar una copia de la base de datos real. Y eso significa tener nombres, correos, teléfonos y consumos de clientes reales en un portátil, en un entorno de pruebas y a veces en varios sitios a la vez.

Con datos sintéticos —mismos volúmenes, mismos patrones de compra, misma distribución de importes, pero clientes que no existen— el trabajo es idéntico y el riesgo desaparece.

Lo que aprendí al hacerlo: generar datos sintéticos útiles es más difícil de lo que parece, porque lo que rompe un sistema no es el caso medio, son los raros. El cliente con la razón social de 90 caracteres, el que tiene tres direcciones de entrega, el importe negativo de un abono, la referencia con una tilde. Si los datos sintéticos son todos «bonitos», las pruebas pasan y producción falla igual.

El truco que funciona: no inventar la distribución, medirla del sistema real —longitudes, frecuencias, porcentaje de campos vacíos— y generar respetándola, incluyendo los extremos.

Y una advertencia que suele pillar a la gente: que un dato sea sintético no lo saca automáticamente del RGPD. Si el método de generación permite reidentificar a alguien —porque un caso raro es tan singular que solo puede ser una persona— sigue siendo dato personal. La singularidad es el enemigo del anonimato.

Errores comunes

  • Creer que sintético equivale a anónimo por definición.
  • Generar solo casos bonitos. Los que rompen el sistema son los raros.
  • Entrenar únicamente con sintéticos y provocar el colapso.
  • No validar contra datos reales. Si el modelo funciona con sintéticos y falla en producción, los datos no imitaban nada.
  • Copiar la distribución sin copiar los errores. Los datos reales tienen campos vacíos, duplicados y erratas; los sintéticos perfectos no preparan para eso.
  • Heredar el sesgo. Si generas a partir de datos sesgados, amplificas el sesgo con volumen. Ver sesgo algorítmico.

Cuándo usarlos

: en desarrollo y pruebas, para formar a gente, para equilibrar clases minoritarias y para simular escenarios que no han ocurrido.

Con cuidado: como parte del entrenamiento, siempre mezclados con datos reales y validando contra ellos.

No: como sustituto completo de los datos reales, ni como coartada para saltarse la protección de datos sin analizar si de verdad son anónimos.

Referencias

Escrito por
Antonio Echeverría

Dirijo IMDICA, una empresa de suministro industrial, desde 2007. Escribo estas definiciones desde el lado de quien las usa para decidir, no desde el de quien las estudia.

Si quieres esto funcionando dentro de tu empresa y no en una demo, lo monto en AE Works.