Dataset o conjunto de datos: qué es
Un dataset o conjunto de datos es una colección de ejemplos reunidos para análisis, entrenamiento, validación o evaluación. Cada ejemplo puede contener características, etiquetas, texto, imágenes, audio u otros valores. Su utilidad no depende solo del tamaño: representatividad, calidad, procedencia, permisos, partición y correspondencia con el uso real determinan qué conclusiones o modelos permite sostener.
Actualizado: 13 de julio de 2026.
Qué contiene un dataset
Un dataset reúne ejemplos bajo una definición y un propósito, pero no convierte datos disponibles en evidencia válida automáticamente. Para interpretarlo necesitas saber quién o qué representa cada ejemplo, cómo se recogió, qué variables incluye, qué quedó fuera y para qué uso fue preparado.
En una tabla típica:
- cada fila es un ejemplo u observación;
- cada columna puede ser una característica, etiqueta, identificador o metadato;
- el esquema define tipos, unidades y valores permitidos;
- la documentación explica origen, cobertura, transformaciones y límites.
Google define un dataset como una colección de ejemplos en su módulo oficial sobre características de los datos. Aunque las tablas son frecuentes, el contenido también puede venir de logs, documentos, audio, vídeo, imágenes, grafos, secuencias o vectores.
Ejemplo de conjunto de datos
Supón un dataset para predecir retrasos de entregas:
| pedido_id | distancia_km | franja | clima | transportista | retraso_min |
|---|---|---|---|---|---|
| P-104 | 8.2 | mañana | lluvia | A | 18 |
| P-105 | 2.7 | tarde | despejado | B | 0 |
| P-106 | 14.1 | noche | lluvia | A | 35 |
distancia_km, franja, clima y transportista pueden ser características. retraso_min puede ser la etiqueta que se quiere predecir. pedido_id identifica el ejemplo, pero incluirlo como característica podría hacer que el modelo memorice patrones accidentales.
La tabla no documenta todavía cuándo se recopilaron los pedidos, qué significa “retraso”, si hay entregas canceladas ni si los datos cubren todas las zonas. Sin ese contexto, el archivo existe, pero su aptitud para entrenar un modelo no está demostrada.
Tipos de datasets
Según su estructura
| Tipo | Ejemplo | Consideración |
|---|---|---|
| Tabular | CSV de transacciones | Tipos, valores faltantes y unidades |
| Texto | Correos, contratos o chats | Idioma, licencia, datos personales y longitud |
| Imagen | Fotografías con clases o cajas | Resolución, condiciones y calidad de anotación |
| Audio | Grabaciones y transcripciones | Ruido, acentos, canales y consentimiento |
| Series temporales | Sensores por minuto | Orden, estacionalidad y cambios de distribución |
| Grafos | Usuarios y relaciones | Definición de aristas y dependencia entre ejemplos |
| Multimodal | Imagen, texto y audio vinculados | Sincronización y correspondencia entre modalidades |
Según la etiqueta
- Etiquetado: cada ejemplo incluye la respuesta objetivo o una anotación.
- No etiquetado: conserva entradas sin una respuesta asignada.
- Débilmente etiquetado: usa reglas, heurísticas o fuentes indirectas.
- Sintético: se genera mediante simulación, reglas o modelos.
- Semi-supervisado: combina pocos ejemplos etiquetados con muchos sin etiqueta.
Un dato sintético puede ampliar cobertura o proteger ciertos datos reales, pero hereda supuestos del generador. Debe evaluarse contra el escenario de destino y mantenerse identificable para no contaminar pruebas que deberían ser reales.
Dataset vs. base de datos, corpus y benchmark
| Término | Qué describe | Ejemplo |
|---|---|---|
| Dataset | Colección delimitada para una tarea o análisis | Exportación versionada de pedidos 2025 |
| Base de datos | Sistema que almacena y consulta datos operativos | PostgreSQL de pedidos vivos |
| Corpus | Colección, normalmente de textos o lenguaje | Artículos en español |
| Benchmark | Dataset más tarea, protocolo y métricas | Prueba cerrada de clasificación |
| Data lake | Repositorio amplio de datos en formatos diversos | Historial bruto de varios sistemas |
Una base cambia con la operación diaria. Para reproducir un experimento, el dataset debería tener una versión estable, un proceso de construcción y una huella verificable. Consultar “los datos actuales” meses después puede producir un conjunto distinto.
Entrenamiento, validación y prueba
La guía de Google para dividir datasets recomienda separar tres funciones:
- Entrenamiento: ajusta los parámetros del modelo.
- Validación: compara variantes, umbrales e hiperparámetros durante el desarrollo.
- Prueba: estima el rendimiento final después de cerrar las decisiones principales.
No existe un porcentaje universal. Una división 70/15/15 es una ilustración, no una ley. El conjunto de prueba necesita suficientes ejemplos para que las métricas sean estables y debe parecerse al uso real.
Evitar fugas entre particiones
Barajar filas al azar puede ser incorrecto:
- en series temporales, entrena con el pasado y prueba en periodos posteriores;
- si una persona genera varias filas, conserva todas en una sola partición;
- si hay fotos casi duplicadas, agrúpalas antes de dividir;
- calcula normalización e imputación solo con entrenamiento;
- no uses la etiqueta ni información futura para construir características;
- reserva el test para el final, sin ajustar repetidamente contra él.
Si el mismo documento aparece fragmentado tanto en entrenamiento como en prueba, una métrica alta puede medir memorización. La unidad de separación debe reflejar la independencia real, no solo el número de fila.
Qué significa calidad de datos
La calidad depende del objetivo. Un dataset útil suele examinar:
| Dimensión | Pregunta |
|---|---|
| Exactitud | ¿Los valores y etiquetas son correctos? |
| Completitud | ¿Faltan campos o grupos importantes? |
| Consistencia | ¿Unidades, categorías y reglas coinciden? |
| Representatividad | ¿Cubre la población y contexto de uso? |
| Oportunidad | ¿Los datos siguen vigentes? |
| Unicidad | ¿Hay duplicados o variantes del mismo ejemplo? |
| Trazabilidad | ¿Se conoce fuente, licencia y transformación? |
| Utilidad | ¿Ayuda a cumplir el objetivo real? |
Más datos no corrigen automáticamente etiquetas erróneas, una población mal definida o una señal irrelevante. Un millón de ejemplos de un solo contexto puede representar peor el destino que un conjunto menor y bien diseñado.
Etiquetas y ground truth
Una etiqueta no siempre es una verdad objetiva. “Fraude confirmado” puede derivar de investigaciones incompletas; “toxicidad” depende de criterios e idioma; un diagnóstico puede tener desacuerdo entre especialistas.
Documenta:
- quién o qué generó la etiqueta;
- instrucciones y categorías disponibles;
- acuerdo entre anotadores;
- tratamiento de casos inciertos;
- revisión y control de calidad;
- fecha y versión de la política;
- diferencia entre etiqueta directa y proxy.
El etiquetado de datos puede incluir múltiples anotaciones por ejemplo y una regla de adjudicación. Ocultar el desacuerdo detrás de una sola clase elimina una señal importante de incertidumbre.
Sesgo, cobertura y cambios de distribución
Compara el dataset con la población y condiciones donde se usará. Revisa rendimiento por segmentos relevantes, pero evita interpretar cualquier diferencia estadística como explicación causal.
Los datos pueden cambiar después del despliegue:
- covariate shift: cambia la distribución de entradas;
- label shift: cambia la frecuencia de etiquetas;
- concept drift: cambia la relación entre entradas y objetivo;
- data drift: término amplio para cambios observados en datos.
Una buena evaluación inicial no evita monitorizar. Registra señales de entrada, resultados permitidos y calidad posterior para detectar cuándo el dataset dejó de representar el entorno.
Privacidad, licencia y seguridad
Antes de reutilizar datos, confirma base legal, consentimiento cuando corresponda, licencia, restricciones contractuales, retención y propósito. Que un archivo sea accesible en internet no significa que pueda incorporarse libremente a un entrenamiento.
Minimiza identificadores, limita acceso y documenta transformaciones. La anonimización puede fallar al cruzar fuentes. Además, un dataset descargado puede contener contenido malicioso, fórmulas de hoja de cálculo, archivos ejecutables o instrucciones diseñadas para afectar pipelines y agentes.
Cómo documentar un dataset
El trabajo Datasheets for Datasets propone documentar motivación, composición, proceso de recolección, preprocesamiento, usos, distribución y mantenimiento. Una ficha práctica debería incluir:
- nombre, propietario, versión, fecha y contacto;
- propósito previsto y usos desaconsejados;
- unidad de análisis y población representada;
- fuentes, licencias y consentimiento;
- esquema, unidades y diccionario de datos;
- estadísticas, faltantes, duplicados y segmentos;
- proceso y calidad de etiquetado;
- estrategia de train/validation/test;
- transformaciones y código de construcción;
- riesgos de privacidad, sesgo y seguridad;
- política de actualizaciones, correcciones y retirada.
La documentación no repara un dataset deficiente, pero hace sus supuestos auditables y permite reproducir cómo se obtuvo.
Lista de control antes de entrenar
- Define la decisión y la población de destino.
- Verifica que cada fila represente la unidad correcta.
- Deduplica antes de dividir.
- Separa por tiempo, grupo o entidad cuando corresponda.
- Calcula estadísticas solo con entrenamiento.
- Revisa etiquetas, desacuerdo y proxies.
- Evalúa cobertura por segmentos relevantes.
- Confirma permisos, privacidad y licencia.
- Versiona datos, código y esquema.
- Conserva un test final y planifica monitorización.
Fuentes oficiales y primarias
- Google Machine Learning Crash Course — Data characteristics.
- Google Machine Learning Crash Course — Dividing datasets.
- Gebru et al. — Datasheets for Datasets.
Preguntas frecuentes
- ¿Qué es un dataset en español?
- Dataset significa conjunto de datos: una colección de ejemplos reunidos con un propósito. Puede adoptar forma de tabla, documentos, imágenes, audio, registros o combinaciones. En machine learning, los ejemplos contienen características y a veces etiquetas para entrenar, validar o evaluar un modelo.
- ¿Cuál es un ejemplo de dataset?
- Una tabla de viviendas es un dataset si cada fila representa una vivienda y las columnas guardan superficie, zona, antigüedad y precio. Para un modelo predictivo, las primeras columnas pueden ser características y el precio la etiqueta. También son datasets una carpeta de imágenes anotadas o un corpus de textos.
- ¿Qué diferencia hay entre dataset y base de datos?
- Un dataset es una colección delimitada para un análisis o tarea; una base de datos es un sistema para almacenar, consultar y actualizar datos. Un dataset puede exportarse desde una base, combinar varias fuentes o existir como archivos. La base gestiona operaciones; el dataset describe el conjunto usado en un experimento.
- ¿Cómo se divide un dataset para machine learning?
- Suele separarse en entrenamiento, validación y prueba. El modelo aprende con entrenamiento; validación guía elecciones durante el desarrollo; prueba estima el resultado final en datos no usados para ajustar. La partición debe evitar duplicados y fugas, y representar el entorno real, a veces respetando tiempo, grupos o usuarios.