Saltar al contenido

Autocodificador (autoencoder): qué es y cómo funciona

Un autocodificador o autoencoder es una red neuronal que aprende a representar una entrada con un código compacto y después intenta reconstruirla. Se entrena reduciendo la diferencia entre el dato original y el reconstruido; esa representación permite comprimir dimensiones, eliminar ruido o detectar anomalías, siempre que el modelo y el umbral se validen con datos adecuados.

Actualizado: 13 de julio de 2026.

Cómo funciona un autocodificador paso a paso

Un autocodificador recibe un dato y aprende a producir una salida parecida a ese mismo dato. El entrenamiento tiene cuatro piezas:

  1. Entrada: puede ser una imagen, una serie temporal, una fila de transacciones o un vector de características.
  2. Codificador (encoder): transforma la entrada en una representación interna más pequeña o restringida.
  3. Espacio latente: contiene el código aprendido. No equivale necesariamente a una compresión de archivo; es una representación numérica útil para el modelo.
  4. Decodificador (decoder): reconstruye la entrada a partir del código. Durante el entrenamiento, una función de pérdida mide la diferencia entre original y reconstrucción y la red ajusta sus pesos para reducirla.

La restricción importa. Si la red tiene demasiada capacidad y ninguna regularización, puede aprender una copia casi idéntica sin descubrir estructura útil. Por eso se usan cuellos de botella, ruido, penalizaciones de dispersión u objetivos probabilísticos según el caso.

Ejemplo sencillo: detectar una transacción anómala

Imagina un modelo entrenado principalmente con transacciones normales. El autocodificador aprende a reconstruir esos patrones habituales con poco error. Una operación muy distinta puede producir un error de reconstrucción alto y convertirse en candidata a revisión.

Eso no demuestra por sí solo que exista fraude. El umbral debe calibrarse con un conjunto de validación y medirse con falsos positivos y falsos negativos. Cambios legítimos en el comportamiento también pueden aumentar el error, de modo que la decisión final necesita contexto y, en usos sensibles, revisión humana.

Para qué sirve un autoencoder

AplicaciónCómo se usaQué hay que comprobar
Reducción de dimensionalidadEl código latente resume una entrada de muchas variablesQue la representación conserve la información relevante para la tarea posterior
Eliminación de ruidoEl modelo recibe una versión alterada y reconstruye el original limpioQue no borre señales raras pero importantes
Detección de anomalíasSe señalan entradas cuyo error de reconstrucción supera un umbralQue el umbral funcione fuera de los datos de entrenamiento
Aprendizaje de representacionesEl encoder produce características que otro modelo puede reutilizarQue esas características mejoren una métrica concreta, no solo la reconstrucción
Generación con VAESe muestrea un espacio latente probabilístico para crear variacionesCalidad, diversidad y sesgos de los datos generados

El tutorial oficial de TensorFlow sobre autoencoders muestra implementaciones básicas para reconstrucción, eliminación de ruido y detección de anomalías. Su ejemplo de anomalías entrena con ritmos normales y usa el error de reconstrucción para identificar observaciones distintas.

Autoencoder vs. PCA vs. VAE

MétodoTipo de representaciónObjetivo principalCuándo encaja mejor
PCALineal y deterministaConservar la mayor varianza posible en menos dimensionesLínea base rápida, interpretable y barata para datos tabulares
Autoencoder clásicoNo lineal y normalmente deterministaReconstruir la entrada desde un código aprendidoPatrones complejos, reducción de dimensionalidad y representaciones
Autoencoder con eliminación de ruidoNo lineal; reconstruye el original desde una entrada corrompidaAprender características robustas al ruidoLimpieza de señal y representación resistente a perturbaciones
VAEProbabilística y regularizadaReconstruir y aprender un espacio latente del que se pueda muestrearGeneración y modelado de variables latentes

El trabajo de Hinton y Salakhutdinov de 2006 mostró que redes profundas con una capa central pequeña podían aprender códigos no lineales para reducir dimensionalidad. Eso no significa que un autoencoder siempre supere a PCA: el resultado depende de arquitectura, datos, regularización y evaluación. PCA sigue siendo una línea base importante por su simplicidad.

Variantes principales

  • Autocodificador disperso: penaliza la activación de muchas unidades para forzar representaciones selectivas.
  • Autocodificador con eliminación de ruido: recibe una entrada alterada y aprende a recuperar la versión limpia. El trabajo de Vincent y colaboradores estudió este criterio para aprender representaciones robustas.
  • Autocodificador convolucional: usa convoluciones y suele aplicarse a imágenes u otras señales con estructura espacial.
  • Autocodificador variacional (VAE): aprende parámetros de una distribución latente. El artículo de Kingma y Welling introdujo un estimador reparametrizado que permite optimizar este modelo con descenso de gradiente.

Límites y errores frecuentes

  • Confundir reconstrucción con comprensión: reproducir bien una entrada no prueba que el modelo haya aprendido conceptos útiles para otra tarea.
  • Usar el error como veredicto: en anomalías, un error alto es una señal para investigar, no una explicación causal ni una decisión automática.
  • Evaluar con los mismos datos: el rendimiento debe medirse con ejemplos separados del entrenamiento y, si es posible, con datos de periodos distintos.
  • Ignorar una línea base: compara contra PCA, reglas simples u otros modelos antes de justificar una red más costosa.
  • Asumir que el espacio latente es interpretable: sus dimensiones no suelen tener un significado humano directo sin análisis adicional.

Si quieres practicar los conceptos que rodean esta técnica, empieza por la ruta de datos y análisis con IA y repasa cómo funcionan una red neuronal y el aprendizaje no supervisado.

Fuentes primarias y documentación

Preguntas frecuentes

¿Qué es un autocodificador?
Un autocodificador es una red neuronal entrenada para reconstruir su propia entrada después de pasarla por una representación interna. Si el diseño impone un cuello de botella, ruido u otra restricción, esa representación puede conservar los patrones más útiles del dato.
¿Para qué sirve un autoencoder?
Se usa para reducir dimensionalidad, eliminar ruido, aprender representaciones y detectar anomalías mediante el error de reconstrucción. La utilidad real depende de evaluar el modelo con datos separados y de elegir métricas y umbrales apropiados para cada problema.
¿Un autoencoder es lo mismo que un VAE?
No. Un autoencoder clásico aprende una codificación normalmente determinista y optimiza la reconstrucción. Un autocodificador variacional o VAE aprende una distribución probabilística en el espacio latente y añade una regularización que permite muestrear y generar datos nuevos.

Términos relacionados

Incrustación vectorial (embedding)Una incrustación vectorial o embedding es una representación numérica de un texto, imagen, audio u otro dato que conserva relaciones de significado. Un modelo convierte cada elemento en un vector; los vectores semánticamente parecidos quedan próximos en el espacio matemático. Esa propiedad permite buscar por significado, recomendar contenido, agrupar ejemplos y recuperar contexto para sistemas RAG sin depender solo de palabras exactas.Red neuronal artificialModelo de cálculo inspirado en el cerebro, compuesto por unidades llamadas neuronas organizadas en capas que se conectan mediante pesos ajustables. Al entrenarse, esos pesos se afinan para transformar entradas en salidas útiles.Aprendizaje no supervisadoEl aprendizaje no supervisado es una rama del machine learning que busca estructura en datos sin una etiqueta objetivo conocida. En vez de aprender la relación entre entradas y una respuesta correcta, identifica similitudes, grupos, componentes, densidades o casos atípicos. Sus resultados son hipótesis sobre los datos: deben interpretarse y evaluarse con métricas, estabilidad y utilidad para una tarea posterior.Agrupamiento (clustering)Técnica de aprendizaje no supervisado que agrupa datos en conjuntos según su similitud, sin etiquetas previas. Útil para segmentar clientes, organizar documentos o detectar patrones ocultos.Red generativa antagónica (GAN)Arquitectura generativa con dos redes que compiten: una genera muestras falsas y otra intenta distinguirlas de las reales. Esa competencia produce resultados cada vez más realistas.

02 / LLEVAR A LA PRÁCTICA

Después de leer

Convierte una idea útil en una habilidad repetible.

Elige una ruta breve, aplícala a una tarea real y termina con algo que puedas revisar, usar o compartir.

Hablar por WhatsApp