Saltar al contenido

Dataset o conjunto de datos: qué es

Un dataset o conjunto de datos es una colección de ejemplos reunidos para análisis, entrenamiento, validación o evaluación. Cada ejemplo puede contener características, etiquetas, texto, imágenes, audio u otros valores. Su utilidad no depende solo del tamaño: representatividad, calidad, procedencia, permisos, partición y correspondencia con el uso real determinan qué conclusiones o modelos permite sostener.

Actualizado: 13 de julio de 2026.

Qué contiene un dataset

Un dataset reúne ejemplos bajo una definición y un propósito, pero no convierte datos disponibles en evidencia válida automáticamente. Para interpretarlo necesitas saber quién o qué representa cada ejemplo, cómo se recogió, qué variables incluye, qué quedó fuera y para qué uso fue preparado.

En una tabla típica:

  • cada fila es un ejemplo u observación;
  • cada columna puede ser una característica, etiqueta, identificador o metadato;
  • el esquema define tipos, unidades y valores permitidos;
  • la documentación explica origen, cobertura, transformaciones y límites.

Google define un dataset como una colección de ejemplos en su módulo oficial sobre características de los datos. Aunque las tablas son frecuentes, el contenido también puede venir de logs, documentos, audio, vídeo, imágenes, grafos, secuencias o vectores.

Ejemplo de conjunto de datos

Supón un dataset para predecir retrasos de entregas:

pedido_iddistancia_kmfranjaclimatransportistaretraso_min
P-1048.2mañanalluviaA18
P-1052.7tardedespejadoB0
P-10614.1nochelluviaA35

distancia_km, franja, clima y transportista pueden ser características. retraso_min puede ser la etiqueta que se quiere predecir. pedido_id identifica el ejemplo, pero incluirlo como característica podría hacer que el modelo memorice patrones accidentales.

La tabla no documenta todavía cuándo se recopilaron los pedidos, qué significa “retraso”, si hay entregas canceladas ni si los datos cubren todas las zonas. Sin ese contexto, el archivo existe, pero su aptitud para entrenar un modelo no está demostrada.

Tipos de datasets

Según su estructura

TipoEjemploConsideración
TabularCSV de transaccionesTipos, valores faltantes y unidades
TextoCorreos, contratos o chatsIdioma, licencia, datos personales y longitud
ImagenFotografías con clases o cajasResolución, condiciones y calidad de anotación
AudioGrabaciones y transcripcionesRuido, acentos, canales y consentimiento
Series temporalesSensores por minutoOrden, estacionalidad y cambios de distribución
GrafosUsuarios y relacionesDefinición de aristas y dependencia entre ejemplos
MultimodalImagen, texto y audio vinculadosSincronización y correspondencia entre modalidades

Según la etiqueta

  • Etiquetado: cada ejemplo incluye la respuesta objetivo o una anotación.
  • No etiquetado: conserva entradas sin una respuesta asignada.
  • Débilmente etiquetado: usa reglas, heurísticas o fuentes indirectas.
  • Sintético: se genera mediante simulación, reglas o modelos.
  • Semi-supervisado: combina pocos ejemplos etiquetados con muchos sin etiqueta.

Un dato sintético puede ampliar cobertura o proteger ciertos datos reales, pero hereda supuestos del generador. Debe evaluarse contra el escenario de destino y mantenerse identificable para no contaminar pruebas que deberían ser reales.

Dataset vs. base de datos, corpus y benchmark

TérminoQué describeEjemplo
DatasetColección delimitada para una tarea o análisisExportación versionada de pedidos 2025
Base de datosSistema que almacena y consulta datos operativosPostgreSQL de pedidos vivos
CorpusColección, normalmente de textos o lenguajeArtículos en español
BenchmarkDataset más tarea, protocolo y métricasPrueba cerrada de clasificación
Data lakeRepositorio amplio de datos en formatos diversosHistorial bruto de varios sistemas

Una base cambia con la operación diaria. Para reproducir un experimento, el dataset debería tener una versión estable, un proceso de construcción y una huella verificable. Consultar “los datos actuales” meses después puede producir un conjunto distinto.

Entrenamiento, validación y prueba

La guía de Google para dividir datasets recomienda separar tres funciones:

  1. Entrenamiento: ajusta los parámetros del modelo.
  2. Validación: compara variantes, umbrales e hiperparámetros durante el desarrollo.
  3. Prueba: estima el rendimiento final después de cerrar las decisiones principales.

No existe un porcentaje universal. Una división 70/15/15 es una ilustración, no una ley. El conjunto de prueba necesita suficientes ejemplos para que las métricas sean estables y debe parecerse al uso real.

Evitar fugas entre particiones

Barajar filas al azar puede ser incorrecto:

  • en series temporales, entrena con el pasado y prueba en periodos posteriores;
  • si una persona genera varias filas, conserva todas en una sola partición;
  • si hay fotos casi duplicadas, agrúpalas antes de dividir;
  • calcula normalización e imputación solo con entrenamiento;
  • no uses la etiqueta ni información futura para construir características;
  • reserva el test para el final, sin ajustar repetidamente contra él.

Si el mismo documento aparece fragmentado tanto en entrenamiento como en prueba, una métrica alta puede medir memorización. La unidad de separación debe reflejar la independencia real, no solo el número de fila.

Qué significa calidad de datos

La calidad depende del objetivo. Un dataset útil suele examinar:

DimensiónPregunta
Exactitud¿Los valores y etiquetas son correctos?
Completitud¿Faltan campos o grupos importantes?
Consistencia¿Unidades, categorías y reglas coinciden?
Representatividad¿Cubre la población y contexto de uso?
Oportunidad¿Los datos siguen vigentes?
Unicidad¿Hay duplicados o variantes del mismo ejemplo?
Trazabilidad¿Se conoce fuente, licencia y transformación?
Utilidad¿Ayuda a cumplir el objetivo real?

Más datos no corrigen automáticamente etiquetas erróneas, una población mal definida o una señal irrelevante. Un millón de ejemplos de un solo contexto puede representar peor el destino que un conjunto menor y bien diseñado.

Etiquetas y ground truth

Una etiqueta no siempre es una verdad objetiva. “Fraude confirmado” puede derivar de investigaciones incompletas; “toxicidad” depende de criterios e idioma; un diagnóstico puede tener desacuerdo entre especialistas.

Documenta:

  • quién o qué generó la etiqueta;
  • instrucciones y categorías disponibles;
  • acuerdo entre anotadores;
  • tratamiento de casos inciertos;
  • revisión y control de calidad;
  • fecha y versión de la política;
  • diferencia entre etiqueta directa y proxy.

El etiquetado de datos puede incluir múltiples anotaciones por ejemplo y una regla de adjudicación. Ocultar el desacuerdo detrás de una sola clase elimina una señal importante de incertidumbre.

Sesgo, cobertura y cambios de distribución

Compara el dataset con la población y condiciones donde se usará. Revisa rendimiento por segmentos relevantes, pero evita interpretar cualquier diferencia estadística como explicación causal.

Los datos pueden cambiar después del despliegue:

  • covariate shift: cambia la distribución de entradas;
  • label shift: cambia la frecuencia de etiquetas;
  • concept drift: cambia la relación entre entradas y objetivo;
  • data drift: término amplio para cambios observados en datos.

Una buena evaluación inicial no evita monitorizar. Registra señales de entrada, resultados permitidos y calidad posterior para detectar cuándo el dataset dejó de representar el entorno.

Privacidad, licencia y seguridad

Antes de reutilizar datos, confirma base legal, consentimiento cuando corresponda, licencia, restricciones contractuales, retención y propósito. Que un archivo sea accesible en internet no significa que pueda incorporarse libremente a un entrenamiento.

Minimiza identificadores, limita acceso y documenta transformaciones. La anonimización puede fallar al cruzar fuentes. Además, un dataset descargado puede contener contenido malicioso, fórmulas de hoja de cálculo, archivos ejecutables o instrucciones diseñadas para afectar pipelines y agentes.

Cómo documentar un dataset

El trabajo Datasheets for Datasets propone documentar motivación, composición, proceso de recolección, preprocesamiento, usos, distribución y mantenimiento. Una ficha práctica debería incluir:

  • nombre, propietario, versión, fecha y contacto;
  • propósito previsto y usos desaconsejados;
  • unidad de análisis y población representada;
  • fuentes, licencias y consentimiento;
  • esquema, unidades y diccionario de datos;
  • estadísticas, faltantes, duplicados y segmentos;
  • proceso y calidad de etiquetado;
  • estrategia de train/validation/test;
  • transformaciones y código de construcción;
  • riesgos de privacidad, sesgo y seguridad;
  • política de actualizaciones, correcciones y retirada.

La documentación no repara un dataset deficiente, pero hace sus supuestos auditables y permite reproducir cómo se obtuvo.

Lista de control antes de entrenar

  1. Define la decisión y la población de destino.
  2. Verifica que cada fila represente la unidad correcta.
  3. Deduplica antes de dividir.
  4. Separa por tiempo, grupo o entidad cuando corresponda.
  5. Calcula estadísticas solo con entrenamiento.
  6. Revisa etiquetas, desacuerdo y proxies.
  7. Evalúa cobertura por segmentos relevantes.
  8. Confirma permisos, privacidad y licencia.
  9. Versiona datos, código y esquema.
  10. Conserva un test final y planifica monitorización.

Fuentes oficiales y primarias

Preguntas frecuentes

¿Qué es un dataset en español?
Dataset significa conjunto de datos: una colección de ejemplos reunidos con un propósito. Puede adoptar forma de tabla, documentos, imágenes, audio, registros o combinaciones. En machine learning, los ejemplos contienen características y a veces etiquetas para entrenar, validar o evaluar un modelo.
¿Cuál es un ejemplo de dataset?
Una tabla de viviendas es un dataset si cada fila representa una vivienda y las columnas guardan superficie, zona, antigüedad y precio. Para un modelo predictivo, las primeras columnas pueden ser características y el precio la etiqueta. También son datasets una carpeta de imágenes anotadas o un corpus de textos.
¿Qué diferencia hay entre dataset y base de datos?
Un dataset es una colección delimitada para un análisis o tarea; una base de datos es un sistema para almacenar, consultar y actualizar datos. Un dataset puede exportarse desde una base, combinar varias fuentes o existir como archivos. La base gestiona operaciones; el dataset describe el conjunto usado en un experimento.
¿Cómo se divide un dataset para machine learning?
Suele separarse en entrenamiento, validación y prueba. El modelo aprende con entrenamiento; validación guía elecciones durante el desarrollo; prueba estima el resultado final en datos no usados para ajustar. La partición debe evitar duplicados y fugas, y representar el entorno real, a veces respetando tiempo, grupos o usuarios.

Términos relacionados

02 / LLEVAR A LA PRÁCTICA

Después de leer

Convierte una idea útil en una habilidad repetible.

Elige una ruta breve, aplícala a una tarea real y termina con algo que puedas revisar, usar o compartir.

Hablar por WhatsApp