Saltar al contenido

Aprendizaje no supervisado

El aprendizaje no supervisado es una rama del machine learning que busca estructura en datos sin una etiqueta objetivo conocida. En vez de aprender la relación entre entradas y una respuesta correcta, identifica similitudes, grupos, componentes, densidades o casos atípicos. Sus resultados son hipótesis sobre los datos: deben interpretarse y evaluarse con métricas, estabilidad y utilidad para una tarea posterior.

Actualizado: 13 de julio de 2026.

Qué es el aprendizaje no supervisado

El aprendizaje no supervisado analiza datos sin etiquetas de respuesta y trata de descubrir cómo se organizan. En un problema supervisado, cada fila puede incluir la respuesta que el modelo debe predecir: por ejemplo, si una transacción fue fraudulenta. En uno no supervisado solo están las características de las observaciones. El algoritmo debe encontrar regularidades sin recibir una clasificación correcta de cada ejemplo.

“No supervisado” no significa que el sistema comprenda por sí solo qué representa cada patrón. Un algoritmo puede separar compras en tres grupos matemáticamente distintos, pero no sabe si esos grupos corresponden a clientes ocasionales, empresas o errores de captura. El significado aparece al combinar el resultado con conocimiento del dominio, análisis de variables y validación.

La definición de Google para aprendizaje no supervisado lo resume como el entrenamiento de un modelo para encontrar patrones, normalmente en un conjunto sin etiquetas. El agrupamiento es el caso más conocido, aunque no es el único.

Cómo funciona paso a paso

  1. Se define la unidad de análisis. Puede ser una persona, documento, imagen, evento, transacción o intervalo de una serie temporal.
  2. Se eligen características. Las variables deben representar la similitud relevante para el problema. Edad y gasto pueden servir para un análisis; palabras, embeddings o señales acústicas para otros.
  3. Se preparan los datos. Se tratan ausencias, escalas, categorías, duplicados y valores extremos. Una variable con números mucho mayores puede dominar una distancia si no se normaliza.
  4. Se elige una técnica y sus supuestos. K-means busca grupos alrededor de centroides; un método jerárquico construye una estructura de agrupaciones; PCA busca direcciones que explican varianza.
  5. Se ajusta el modelo. El algoritmo optimiza su propio criterio, no una tasa de acierto contra etiquetas desconocidas.
  6. Se interpreta y evalúa. Se estudian perfiles, estabilidad, sensibilidad a parámetros y utilidad en decisiones posteriores.

La parte decisiva suele ocurrir antes de ejecutar el algoritmo. Dos equipos pueden obtener agrupaciones opuestas con las mismas filas si definen de forma distinta la similitud, las variables o la escala. Google destaca que la medida de similitud debe corresponder al caso de uso, especialmente cuando crece el número de características.

Técnicas principales

TécnicaQué descubreEjemplo de usoPregunta de control
ClusteringGrupos de ejemplos similaresSegmentos de productos o documentos¿Los grupos son estables y accionables?
Reducción de dimensionalidadRepresentaciones con menos variablesVisualización o preparación de un modelo¿Conserva la información relevante?
Detección de anomalíasObservaciones alejadas del patrón habitualOperaciones candidatas a revisión¿Cuál es el coste de falsos positivos?
Estimación de densidadRegiones más o menos probablesModelar distribuciones y rarezas¿Los supuestos representan los datos?
Reglas de asociaciónElementos que aparecen juntosPatrones de cesta de compra¿La asociación es útil y no accidental?

Agrupamiento o clustering

El clustering reúne ejemplos parecidos según una medida de similitud. K-means asigna cada ejemplo al centroide más cercano y actualiza los centroides de forma iterativa. Otros métodos pueden encontrar grupos jerárquicos, regiones densas o formas que K-means no representa bien.

La cantidad de grupos no siempre existe de manera “natural”. Elegir cinco porque el negocio quiere cinco segmentos no demuestra que los datos sostengan esa separación. La guía de Google sobre evaluación de clustering recomienda revisar, entre otros aspectos, cardinalidad, magnitud y desempeño en tareas posteriores.

Reducción de dimensionalidad

PCA transforma variables correlacionadas en componentes que capturan varianza. Puede ayudar a visualizar, comprimir o preparar datos, pero una componente con mucha varianza no es necesariamente la más útil para el objetivo de negocio. La documentación de scikit-learn explica cómo pasos no supervisados de reducción pueden encadenarse antes de un estimador supervisado.

Un autocodificador también puede aprender una representación compacta, normalmente no lineal. Requiere más decisiones de arquitectura y evaluación que PCA; por eso PCA suele ser una línea base sensata.

Detección de anomalías

La detección de valores atípicos intenta separar un núcleo de observaciones habituales de casos poco frecuentes. No equivale a clasificar fraude, enfermedad o fallo. Una anomalía es diferente según el modelo y las variables; puede ser un error, una novedad legítima o un caso importante.

Scikit-learn distingue detección de valores atípicos y de novedades: en la primera, los datos de ajuste ya pueden contener observaciones anómalas; en la segunda se parte de ejemplos considerados normales y se evalúan casos nuevos.

Ejemplo: segmentar clientes sin etiquetas

Supón una tabla con frecuencia de compra, importe medio, diversidad de categorías y días desde la última compra. No existe una columna “tipo de cliente”. Un flujo razonable sería:

  1. revisar distribución, ausencias y periodos comparables;
  2. transformar variables muy sesgadas y escalar las características;
  3. probar varias cantidades de grupos y semillas;
  4. comparar estabilidad y separación;
  5. describir cada grupo con variables que no se usaron para formarlo;
  6. probar una acción pequeña y medir su efecto.

El algoritmo podría encontrar un grupo de compras frecuentes y bajo importe, otro de compras estacionales y uno de alto importe reciente. Esos nombres los asigna el analista, no el modelo. Si los grupos cambian por completo al retirar una variable o mover el periodo un mes, no son una base sólida para automatizar decisiones.

Aprendizaje no supervisado vs. supervisado vs. autosupervisado

EnfoqueSeñal de entrenamientoResultado típicoEvaluación principal
SupervisadoEtiqueta objetivo conocidaPredicción de clase o valorMétricas sobre ejemplos etiquetados reservados
No supervisadoSin etiqueta objetivoGrupos, componentes o rarezasEstabilidad, métricas internas y utilidad externa
AutosupervisadoObjetivo creado a partir de los datosRepresentaciones reutilizablesDesempeño del objetivo y tareas posteriores
Por refuerzoRecompensa de acciones en un entornoPolítica de decisiónRetorno, seguridad y generalización

El preentrenamiento de muchos modelos de lenguaje es autosupervisado, no simplemente no supervisado: el texto permite construir un objetivo, como predecir el siguiente token. Esta precisión evita mezclar técnicas con mecanismos de entrenamiento diferentes.

Cómo evaluar sin etiquetas

La ausencia de una verdad objetivo hace que una sola puntuación sea insuficiente. Combina varias evidencias:

  • Estabilidad: repite con otras muestras, semillas o periodos y comprueba si la estructura persiste.
  • Coherencia interna: usa métricas compatibles con el algoritmo, sabiendo que favorecen determinados tipos de grupo.
  • Interpretabilidad: describe qué variables distinguen cada patrón y si esa descripción tiene sentido en el dominio.
  • Validación externa: cuando existan etiquetas parciales o eventos posteriores, comprueba si el resultado se relaciona con ellos sin haberlos usado para ajustar.
  • Utilidad posterior: mide si la representación mejora búsqueda, recomendación, predicción o una decisión real.
  • Sensibilidad: cambia escala, variables y parámetros para identificar conclusiones frágiles.

No elijas un modelo solo porque produce un gráfico visualmente limpio. Proyecciones a dos dimensiones pueden ocultar distancias o crear separaciones que no existen en el espacio original.

Errores frecuentes y límites

  • Llamar “verdad” a un cluster. Un grupo es el resultado de datos, representación, similitud, algoritmo y parámetros concretos.
  • Incluir variables que filtran el resultado. Identificadores, fechas o campos derivados pueden crear segmentos artificiales.
  • Olvidar la escala. Distancias euclidianas cambian si una característica domina numéricamente.
  • Interpretar correlación como causa. Que dos productos aparezcan juntos no prueba que uno provoque la compra del otro.
  • Automatizar decisiones sensibles. Un cluster puede heredar sesgos y no debería convertirse sin evaluación en acceso, precio o riesgo de una persona.
  • Evaluar en los mismos datos y periodo. Los patrones pueden degradarse cuando cambian mercado, población o captura.

Cuándo conviene usarlo

Úsalo para explorar un conjunto, crear hipótesis, preparar características, organizar información o priorizar casos para revisión. Es especialmente útil cuando las etiquetas son caras o todavía no sabes qué estructura buscar.

No lo uses como sustituto de una pregunta clara. Si ya existe una respuesta fiable y el objetivo es predecirla, un problema supervisado puede ser más directo. Si una regla simple separa los casos y debe ser auditable, quizá no necesitas un modelo.

Para practicar, empieza con una tabla pequeña y un propósito verificable. Compara una línea base, documenta las transformaciones y pide a alguien del dominio que intente refutar la interpretación. El valor no está en “descubrir tres grupos”, sino en demostrar qué decisión mejora y con qué riesgos.

Fuentes y documentación

Preguntas frecuentes

¿Qué es el aprendizaje no supervisado en palabras simples?
Es una forma de machine learning que analiza ejemplos sin una respuesta correcta asociada y busca regularidades. Puede agrupar observaciones parecidas, resumir muchas variables en pocas dimensiones o señalar casos inusuales, pero una persona debe interpretar qué significan esos resultados.
¿Cuál es un ejemplo de aprendizaje no supervisado?
Un ejemplo es agrupar clientes según frecuencia, importe y tipo de compra sin definir antes los segmentos. El algoritmo propone grupos por similitud; después el equipo comprueba si son estables, comprensibles y útiles para una acción concreta.
¿Cuál es la diferencia entre aprendizaje supervisado y no supervisado?
El supervisado aprende con una variable objetivo conocida, como fraude o no fraude, y puede medirse contra respuestas reservadas. El no supervisado no dispone de esa verdad objetivo y descubre estructura; por eso se evalúa con estabilidad, coherencia, métricas internas y utilidad posterior.
¿El aprendizaje no supervisado es lo mismo que el autosupervisado?
No. El aprendizaje autosupervisado crea objetivos a partir de los propios datos, como ocultar una palabra y pedir al modelo que la prediga. Sigue teniendo una señal de entrenamiento construida. El no supervisado clásico busca estructura sin una etiqueta objetivo de ese tipo.

Términos relacionados

02 / LLEVAR A LA PRÁCTICA

Después de leer

Convierte una idea útil en una habilidad repetible.

Elige una ruta breve, aplícala a una tarea real y termina con algo que puedas revisar, usar o compartir.

Hablar por WhatsApp