Aprendizaje por refuerzo: qué es y cómo funciona
El aprendizaje por refuerzo o reinforcement learning es un paradigma de machine learning en el que un agente aprende una política de acciones al interactuar con un entorno. Cada acción modifica el estado y produce una recompensa; el objetivo no es acertar una etiqueta aislada, sino maximizar la recompensa acumulada a largo plazo mediante ensayo, evaluación y exploración controlada.
Actualizado: 13 de julio de 2026.
Cómo funciona el aprendizaje por refuerzo
El aprendizaje por refuerzo convierte una secuencia de decisiones en un problema de optimización. En cada paso ocurre este ciclo:
- el agente recibe un estado u observación del entorno;
- su política elige una acción;
- el entorno cambia y devuelve una nueva observación;
- el agente recibe una recompensa;
- el algoritmo actualiza lo aprendido para favorecer mejores resultados futuros.
La recompensa inmediata no siempre coincide con el objetivo real. En ajedrez, capturar una pieza puede parecer positivo y conducir a una derrota varios turnos después. Por eso se optimiza el retorno, una combinación de recompensas presentes y futuras, a menudo descontadas con un factor gamma.
La introducción de OpenAI Spinning Up resume el campo como el estudio de agentes que aprenden por ensayo y error para maximizar recompensa acumulada. Esa definición incluye una dificultad central: el agente aprende de la señal que recibe, no de la intención que el diseñador tenía en mente.
Elementos de un problema de reinforcement learning
| Elemento | Pregunta que responde | Ejemplo de robot móvil |
|---|---|---|
| Agente | ¿Quién decide? | El controlador del robot |
| Entorno | ¿Dónde actúa? | Almacén, obstáculos y personas |
| Estado | ¿Qué información resume la situación? | Posición, velocidad y batería |
| Observación | ¿Qué puede percibir realmente? | Lecturas de cámara y sensores |
| Acción | ¿Qué puede hacer? | Girar, acelerar o frenar |
| Recompensa | ¿Qué señal recibe? | Entrega completada menos choques y consumo |
| Política | ¿Cómo elige la acción? | Distribución de acciones según la observación |
| Retorno | ¿Qué intenta maximizar? | Suma de recompensas a lo largo del recorrido |
Estado y observación no siempre son equivalentes. El estado puede contener toda la información relevante del entorno, mientras que el agente solo observa una parte ruidosa. Un vehículo no conoce la intención exacta de un peatón; la estima a partir de señales incompletas.
Ejemplo paso a paso
Imagina un sistema que decide cuándo cargar una batería industrial:
- el estado incluye precio eléctrico, nivel de carga y demanda prevista;
- las acciones son cargar, esperar o descargar;
- la recompensa combina coste energético, cumplimiento de demanda y degradación;
- la política aprende qué acción conviene en cada contexto;
- un episodio puede representar un día completo de operación.
Una regla que minimice el precio de este instante puede fallar si deja la batería vacía antes de un pico de demanda. El aprendizaje por refuerzo considera esas consecuencias temporales. Sin embargo, no basta con ejecutar experimentos en producción: las acciones inseguras deberían limitarse, simularse o pasar por una política de respaldo.
Aprendizaje por refuerzo vs. otros paradigmas
| Paradigma | Señal de aprendizaje | Dependencia temporal | Ejemplo |
|---|---|---|---|
| Supervisado | Etiqueta o valor correcto por ejemplo | Normalmente baja | Clasificar correos como spam |
| No supervisado | Estructura presente en los datos | No es requisito | Agrupar clientes similares |
| Por refuerzo | Recompensa producida por la interacción | Central | Elegir acciones para controlar un robot |
| Imitación | Demostraciones de una política experta | Habitual | Aprender a conducir desde trayectorias humanas |
El aprendizaje por refuerzo no es simplemente “supervisado con recompensas”. La acción elegida altera los datos que el agente observará después. Además, debe resolver el dilema entre explorar acciones inciertas y explotar la mejor acción conocida.
Proceso de decisión de Markov
Muchos problemas se formalizan como un proceso de decisión de Markov (MDP) con estados, acciones, probabilidades de transición, recompensas y un factor de descuento. La propiedad de Markov supone que el estado actual contiene la información necesaria para modelar el futuro, sin tener que conservar toda la historia.
En el mundo real esa suposición puede no cumplirse. Si el agente recibe observaciones parciales, el problema se aproxima mejor con un POMDP o con una política que mantenga memoria. Nombrar un problema como MDP no demuestra que el estado elegido sea suficiente.
Familias de algoritmos
Métodos basados en valor
Aprenden cuánto retorno puede esperar el agente desde un estado o una pareja estado-acción. Q-learning y DQN pertenecen a esta familia. La política puede escoger la acción con mayor valor estimado.
Métodos de gradiente de política
Optimizan directamente los parámetros de la política. Resultan naturales para acciones continuas o políticas probabilísticas, aunque las estimaciones del gradiente pueden tener alta varianza.
Actor-crítico
Combinan un actor, que propone acciones, y un crítico, que estima su calidad. PPO, SAC y otros algoritmos usan variantes de esta idea.
Con modelo y sin modelo
Un método con modelo aprende o conoce cómo evoluciona el entorno y puede planificar antes de actuar. Uno sin modelo aprende valores o políticas sin representar explícitamente esa dinámica. Tener un modelo puede mejorar la eficiencia de datos, pero sus errores también se acumulan durante la planificación.
On-policy y off-policy
Los algoritmos on-policy aprenden principalmente de datos recogidos por la política actual. Los off-policy pueden reutilizar experiencia de otras políticas, por ejemplo desde un búfer de repetición. Esa reutilización ayuda, pero exige controlar diferencias entre la distribución de los datos y la política que se quiere optimizar.
Relación entre RL, RLHF y modelos de razonamiento
El RLHF aplica ideas de preferencias y recompensa para orientar un modelo hacia respuestas que evaluadores humanos consideran mejores. Un flujo posible recopila comparaciones, entrena un modelo de recompensa y optimiza la política del modelo. No todo ajuste por preferencias usa necesariamente ese flujo: métodos de optimización directa pueden aprender de pares preferidos sin un bucle de RL tradicional.
En modelos de razonamiento, una recompensa verificable puede valorar si el resultado de matemáticas o código es correcto. Eso no garantiza que cada explicación escrita revele el proceso interno real ni que el comportamiento se generalice fuera de las tareas evaluadas.
Riesgos y errores frecuentes
| Riesgo | Qué ocurre | Mitigación inicial |
|---|---|---|
| Reward hacking | El agente maximiza una métrica sin cumplir la intención | Revisar casos límite y varias señales de éxito |
| Exploración insegura | Prueba una acción peligrosa para aprender | Simulación, límites duros y política segura |
| Recompensa escasa | La señal útil llega muy tarde | Diseño de currículo o señales auxiliares cuidadosas |
| Sobreajuste al simulador | Funciona en simulación y falla en el entorno real | Variación del dominio y pruebas controladas |
| Inestabilidad | Cambios pequeños producen políticas muy distintas | Varias semillas, curvas y evaluación fuera de muestra |
| Coste de interacción | Reunir episodios reales es lento o caro | Aprendizaje offline, simulación o método más simple |
Una recompensa detallada puede acelerar el aprendizaje y, a la vez, introducir atajos inesperados. Antes de optimizarla, conviene escribir ejemplos de comportamiento deseado, indeseado y ambiguo, además de restricciones que nunca deben violarse.
Cómo evaluar un agente
No informes únicamente la recompensa de entrenamiento. Mide al menos:
- retorno promedio y distribución entre episodios;
- porcentaje de éxito y tasa de violaciones de seguridad;
- rendimiento en escenarios no vistos;
- cantidad de interacciones necesaria para aprender;
- estabilidad entre semillas y versiones del entorno;
- latencia, consumo y coste de inferencia;
- degradación frente a cambios o perturbaciones.
La evaluación debe separar los datos usados para ajustar hiperparámetros de los escenarios reservados para la prueba final. También necesita una línea base: una regla sencilla o un método supervisado puede ser más fiable y barato.
Cuándo usar aprendizaje por refuerzo
Es una opción razonable cuando hay decisiones secuenciales, consecuencias diferidas, un entorno que puede simularse o medirse y suficientes interacciones seguras. Aparece en control, robótica, juegos, programación de recursos y optimización de políticas.
No suele ser la primera opción para clasificar datos independientes, ejecutar una regla conocida o resolver una tarea con pocas interacciones y alto riesgo. Si existe una etiqueta correcta por ejemplo, empieza por supervisado. Si una solución determinista satisface el objetivo, no necesitas que un agente descubra la regla por ensayo y error.
Fuentes primarias y técnicas
- OpenAI Spinning Up — Key concepts in reinforcement learning.
- Sutton y Barto — Reinforcement Learning: An Introduction.
Preguntas frecuentes
- ¿Qué es el aprendizaje por refuerzo?
- Es un paradigma en el que un agente aprende qué acciones tomar al interactuar con un entorno. Recibe recompensas y busca una política que maximice el retorno acumulado. A diferencia del aprendizaje supervisado, no necesita una respuesta correcta para cada decisión, pero sí una señal de objetivo bien diseñada.
- ¿Cuál es un ejemplo de aprendizaje por refuerzo?
- Un ejemplo es un robot que aprende a mantener el equilibrio. Observa su posición, elige un movimiento, recibe una recompensa por avanzar sin caer y actualiza su política. También se usa en juegos, control industrial, asignación de recursos y algunos procesos de alineamiento de modelos.
- ¿Qué diferencia hay entre aprendizaje por refuerzo y aprendizaje supervisado?
- El aprendizaje supervisado ajusta predicciones contra etiquetas conocidas y suele evaluar cada ejemplo por separado. El aprendizaje por refuerzo aprende de consecuencias que pueden aparecer más tarde: una acción cambia el entorno y afecta las decisiones siguientes, por lo que importa la secuencia y la recompensa acumulada.
- ¿Aprendizaje por refuerzo y RLHF son lo mismo?
- No. El aprendizaje por refuerzo es el paradigma general. RLHF es una familia de técnicas para ajustar modelos a partir de retroalimentación humana, normalmente usando preferencias o un modelo de recompensa. Además, existen métodos de preferencia que no ejecutan un algoritmo de refuerzo clásico.