Datos sintéticos
Los datos sintéticos son registros creados artificialmente mediante reglas, simulaciones o modelos generativos para reproducir propiedades útiles de datos reales. Pueden servir para entrenar, probar o compartir sistemas cuando los ejemplos reales son escasos o sensibles, pero no garantizan por sí solos privacidad, fidelidad ni ausencia de sesgo.
Actualizado: 13 de julio de 2026.
Qué son los datos sintéticos
Los datos sintéticos son observaciones creadas artificialmente para representar patrones, restricciones o escenarios de interés. Pueden generarse a partir de reglas, una simulación del mundo, distribuciones estadísticas o modelos de IA entrenados con datos reales. El resultado puede adoptar la forma de una tabla de clientes ficticios, imágenes de una carretera simulada, conversaciones de ejemplo o señales producidas por un gemelo digital.
No basta con que los registros “parezcan reales”. Un conjunto sintético solo es útil si conserva las propiedades necesarias para una tarea concreta y, al mismo tiempo, mantiene bajo control riesgos como la filtración de información, el sesgo o la distorsión estadística.
Cómo se generan los datos sintéticos
Hay cuatro familias frecuentes:
- Reglas y plantillas. Se definen formatos, rangos y relaciones de forma explícita. Es una opción predecible para probar formularios, APIs o flujos de negocio, aunque puede producir poca variedad.
- Simulación. Un motor reproduce un proceso conocido: tráfico, sensores, una fábrica, una transacción o un entorno 3D. Permite crear escenarios raros y controlar la “verdad” de cada etiqueta.
- Modelos estadísticos. Estiman distribuciones y dependencias del conjunto original para muestrear nuevos registros. Son comunes en datos tabulares.
- Modelos generativos. Una GAN, un modelo de difusión, un VAE o un modelo de lenguaje aprende patrones y genera ejemplos nuevos. Pueden capturar estructuras complejas, pero también memorizar, exagerar sesgos o producir artefactos.
Un flujo híbrido puede combinar una simulación con modelos generativos y filtros basados en reglas. Por ejemplo, un simulador crea escenas de conducción, un modelo modifica clima e iluminación y una validación final descarta imágenes físicamente incoherentes.
Datos sintéticos vs. datos reales y aumento de datos
| Enfoque | De dónde sale | Ventaja principal | Riesgo principal |
|---|---|---|---|
| Datos reales | Observaciones del mundo o de producción | Reflejan el fenómeno observado | Coste, escasez, permisos y privacidad |
| Aumento de datos | Transformaciones de ejemplos existentes | Amplía variaciones con poco coste | Repite limitaciones del conjunto de origen |
| Datos sintéticos | Reglas, simulación o un generador aprendido | Controla escenarios y crea observaciones nuevas | Distorsión, memorias del original o realismo superficial |
El aumento suele conservar la identidad semántica de un ejemplo: recortar una foto, cambiar su brillo o añadir ruido. La síntesis puede crear una observación completa que no existía antes. La frontera no siempre es rígida, pero la pregunta práctica es la misma: ¿la operación añade evidencia útil o solo multiplica patrones ya presentes?
Para qué sirven los datos sintéticos
- Cubrir casos raros o peligrosos. Una simulación puede representar fallos industriales, fraudes o condiciones de conducción difíciles sin esperar a que ocurran.
- Equilibrar clases. Se pueden añadir ejemplos de una categoría minoritaria, siempre que el generador reproduzca su diversidad y no una caricatura repetitiva.
- Probar software. Equipos de desarrollo pueden validar volúmenes, formatos y errores sin copiar directamente bases de producción.
- Entrenar modelos. Imágenes, texto, audio o tablas sintéticas pueden complementar un conjunto de datos real cuando faltan ejemplos etiquetados.
- Compartir y explorar datos. Una versión sintética puede facilitar análisis iniciales, pero debe pasar controles de privacidad antes de considerarse segura.
- Crear escenarios controlados. Al conocer las reglas de generación es posible producir etiquetas exactas y variar una condición cada vez.
La revisión académica Machine Learning for Synthetic Data Generation organiza aplicaciones en visión, lenguaje, voz, salud y datos empresariales, y subraya que calidad, privacidad y equidad deben evaluarse juntas.
Cómo evaluar un conjunto sintético
No existe una puntuación universal. La evaluación debe responder al uso previsto y comparar, cuando sea posible, datos reales reservados con datos sintéticos.
1. Validez
Comprueba tipos, rangos, claves, restricciones y relaciones lógicas. Una fecha futura imposible, una edad negativa o una clave huérfana hacen que un registro falle aunque su distribución general parezca correcta.
2. Fidelidad estadística
Compara distribuciones de columnas, correlaciones, cardinalidades y relaciones entre variables. La documentación de Synthetic Data Vault separa, por ejemplo, la forma de las columnas, las tendencias entre pares y la cardinalidad. Una semejanza agregada alta no demuestra que todos los subgrupos estén bien representados.
3. Utilidad para la tarea
Entrena o prueba el sistema que realmente se usará. Una estrategia común es entrenar con datos sintéticos y evaluar con un conjunto real que el generador nunca vio. También conviene comparar esa métrica con un modelo entrenado en datos reales y con una línea base simple. La utilidad de una tabla para clasificación no garantiza que sirva para estimar causalidad, detectar valores extremos o calcular otra estadística.
4. Privacidad
Busca coincidencias exactas y casi exactas, riesgo de pertenencia, inferencia de atributos y reproducción de casos únicos. La herramienta SDNist de NIST genera informes separados de utilidad y privacidad para datos tabulares sintéticos.
La guía NIST SP 800-226 advierte que los métodos sintéticos sin privacidad diferencial ofrecen garantías informales y pueden seguir siendo vulnerables a ataques. Por tanto, “sintético” no equivale a “anónimo”.
5. Equidad y cobertura
Mide resultados por subgrupo y por escenario raro. Un generador puede ajustar bien la mayoría y borrar precisamente las colas que motivaron el proyecto. Revisa tasas de error, cobertura y utilidad por grupo, no solo un promedio global.
Riesgos y límites
Sesgo amplificado. Si el conjunto original omite una población o contiene una relación discriminatoria, el generador puede reproducirla o acentuarla.
Privacidad aparente. Un registro nuevo puede estar demasiado cerca de una persona real. Los modelos con capacidad alta también pueden memorizar ejemplos de entrenamiento.
Realismo sin utilidad. Una imagen convincente o una conversación fluida puede fallar en la señal que necesita el modelo. La calidad visual no sustituye una prueba para la tarea final.
Cambio de distribución. Un generador representa el pasado y sus supuestos. Si el proceso real cambia, el conjunto sintético queda desactualizado igual que cualquier otro dato.
Bucle de contaminación. Reentrenar repetidamente con salidas de modelos sin conservar una referencia real puede reducir diversidad y reforzar errores. Registra siempre la procedencia de cada muestra y limita el peso de datos derivados.
Etiquetas equivocadas. Que una simulación produzca etiquetas automáticamente no garantiza que la lógica de la simulación sea correcta. Las reglas y los casos frontera también necesitan revisión.
Checklist antes de usar datos sintéticos
- Define la decisión, prueba o modelo que el conjunto debe soportar.
- Conserva una muestra real separada para evaluación; no la uses para ajustar el generador.
- Documenta origen, método, parámetros, fecha, proporción sintética y transformaciones.
- Valida restricciones y distribuciones, incluidas las relaciones entre variables.
- Mide utilidad en la tarea final y por subgrupo.
- Ejecuta pruebas de privacidad acordes con la sensibilidad del original.
- Compara contra una línea base real y contra no usar datos sintéticos.
- Revisa manualmente muestras y casos extremos antes de publicar o entrenar.
- Mantén datos sintéticos y reales identificables en el pipeline para poder auditar resultados.
- Repite la evaluación cuando cambien el fenómeno, el generador o el uso previsto.
Los datos sintéticos son una herramienta para ampliar evidencia y controlar experimentos, no una licencia para omitir gobernanza. Combínalos con etiquetado de datos, evaluación sobre datos reales y documentación suficiente para saber qué aprendió el modelo y de dónde provino cada señal.
Preguntas frecuentes
- ¿Qué son los datos sintéticos?
- Son registros artificiales generados mediante reglas, simulaciones o modelos para conservar patrones útiles de un conjunto real o representar escenarios definidos. No son una copia exacta de los datos originales y su calidad debe medirse para el uso previsto.
- ¿Para qué sirven los datos sintéticos en inteligencia artificial?
- Se usan para entrenar y probar modelos, representar casos raros, equilibrar clases, desarrollar software sin depender siempre de datos productivos y crear entornos de simulación. Su utilidad depende de que reproduzcan las relaciones relevantes para la tarea.
- ¿Los datos sintéticos son anónimos y privados?
- No automáticamente. Un generador puede memorizar o reproducir información del conjunto original. La privacidad requiere una evaluación de ataques y coincidencias y, cuando el riesgo lo exige, garantías formales como privacidad diferencial.
- ¿Qué diferencia hay entre datos sintéticos y aumento de datos?
- El aumento de datos transforma ejemplos existentes, por ejemplo al rotar una imagen o añadir ruido. La generación sintética crea observaciones nuevas mediante una simulación, un modelo estadístico o un modelo generativo, aunque ambos enfoques pueden combinarse.