Saltar al contenido

Aprendizaje por refuerzo: qué es y cómo funciona

El aprendizaje por refuerzo o reinforcement learning es un paradigma de machine learning en el que un agente aprende una política de acciones al interactuar con un entorno. Cada acción modifica el estado y produce una recompensa; el objetivo no es acertar una etiqueta aislada, sino maximizar la recompensa acumulada a largo plazo mediante ensayo, evaluación y exploración controlada.

Actualizado: 13 de julio de 2026.

Cómo funciona el aprendizaje por refuerzo

El aprendizaje por refuerzo convierte una secuencia de decisiones en un problema de optimización. En cada paso ocurre este ciclo:

  1. el agente recibe un estado u observación del entorno;
  2. su política elige una acción;
  3. el entorno cambia y devuelve una nueva observación;
  4. el agente recibe una recompensa;
  5. el algoritmo actualiza lo aprendido para favorecer mejores resultados futuros.

La recompensa inmediata no siempre coincide con el objetivo real. En ajedrez, capturar una pieza puede parecer positivo y conducir a una derrota varios turnos después. Por eso se optimiza el retorno, una combinación de recompensas presentes y futuras, a menudo descontadas con un factor gamma.

La introducción de OpenAI Spinning Up resume el campo como el estudio de agentes que aprenden por ensayo y error para maximizar recompensa acumulada. Esa definición incluye una dificultad central: el agente aprende de la señal que recibe, no de la intención que el diseñador tenía en mente.

Elementos de un problema de reinforcement learning

ElementoPregunta que respondeEjemplo de robot móvil
Agente¿Quién decide?El controlador del robot
Entorno¿Dónde actúa?Almacén, obstáculos y personas
Estado¿Qué información resume la situación?Posición, velocidad y batería
Observación¿Qué puede percibir realmente?Lecturas de cámara y sensores
Acción¿Qué puede hacer?Girar, acelerar o frenar
Recompensa¿Qué señal recibe?Entrega completada menos choques y consumo
Política¿Cómo elige la acción?Distribución de acciones según la observación
Retorno¿Qué intenta maximizar?Suma de recompensas a lo largo del recorrido

Estado y observación no siempre son equivalentes. El estado puede contener toda la información relevante del entorno, mientras que el agente solo observa una parte ruidosa. Un vehículo no conoce la intención exacta de un peatón; la estima a partir de señales incompletas.

Ejemplo paso a paso

Imagina un sistema que decide cuándo cargar una batería industrial:

  • el estado incluye precio eléctrico, nivel de carga y demanda prevista;
  • las acciones son cargar, esperar o descargar;
  • la recompensa combina coste energético, cumplimiento de demanda y degradación;
  • la política aprende qué acción conviene en cada contexto;
  • un episodio puede representar un día completo de operación.

Una regla que minimice el precio de este instante puede fallar si deja la batería vacía antes de un pico de demanda. El aprendizaje por refuerzo considera esas consecuencias temporales. Sin embargo, no basta con ejecutar experimentos en producción: las acciones inseguras deberían limitarse, simularse o pasar por una política de respaldo.

Aprendizaje por refuerzo vs. otros paradigmas

ParadigmaSeñal de aprendizajeDependencia temporalEjemplo
SupervisadoEtiqueta o valor correcto por ejemploNormalmente bajaClasificar correos como spam
No supervisadoEstructura presente en los datosNo es requisitoAgrupar clientes similares
Por refuerzoRecompensa producida por la interacciónCentralElegir acciones para controlar un robot
ImitaciónDemostraciones de una política expertaHabitualAprender a conducir desde trayectorias humanas

El aprendizaje por refuerzo no es simplemente “supervisado con recompensas”. La acción elegida altera los datos que el agente observará después. Además, debe resolver el dilema entre explorar acciones inciertas y explotar la mejor acción conocida.

Proceso de decisión de Markov

Muchos problemas se formalizan como un proceso de decisión de Markov (MDP) con estados, acciones, probabilidades de transición, recompensas y un factor de descuento. La propiedad de Markov supone que el estado actual contiene la información necesaria para modelar el futuro, sin tener que conservar toda la historia.

En el mundo real esa suposición puede no cumplirse. Si el agente recibe observaciones parciales, el problema se aproxima mejor con un POMDP o con una política que mantenga memoria. Nombrar un problema como MDP no demuestra que el estado elegido sea suficiente.

Familias de algoritmos

Métodos basados en valor

Aprenden cuánto retorno puede esperar el agente desde un estado o una pareja estado-acción. Q-learning y DQN pertenecen a esta familia. La política puede escoger la acción con mayor valor estimado.

Métodos de gradiente de política

Optimizan directamente los parámetros de la política. Resultan naturales para acciones continuas o políticas probabilísticas, aunque las estimaciones del gradiente pueden tener alta varianza.

Actor-crítico

Combinan un actor, que propone acciones, y un crítico, que estima su calidad. PPO, SAC y otros algoritmos usan variantes de esta idea.

Con modelo y sin modelo

Un método con modelo aprende o conoce cómo evoluciona el entorno y puede planificar antes de actuar. Uno sin modelo aprende valores o políticas sin representar explícitamente esa dinámica. Tener un modelo puede mejorar la eficiencia de datos, pero sus errores también se acumulan durante la planificación.

On-policy y off-policy

Los algoritmos on-policy aprenden principalmente de datos recogidos por la política actual. Los off-policy pueden reutilizar experiencia de otras políticas, por ejemplo desde un búfer de repetición. Esa reutilización ayuda, pero exige controlar diferencias entre la distribución de los datos y la política que se quiere optimizar.

Relación entre RL, RLHF y modelos de razonamiento

El RLHF aplica ideas de preferencias y recompensa para orientar un modelo hacia respuestas que evaluadores humanos consideran mejores. Un flujo posible recopila comparaciones, entrena un modelo de recompensa y optimiza la política del modelo. No todo ajuste por preferencias usa necesariamente ese flujo: métodos de optimización directa pueden aprender de pares preferidos sin un bucle de RL tradicional.

En modelos de razonamiento, una recompensa verificable puede valorar si el resultado de matemáticas o código es correcto. Eso no garantiza que cada explicación escrita revele el proceso interno real ni que el comportamiento se generalice fuera de las tareas evaluadas.

Riesgos y errores frecuentes

RiesgoQué ocurreMitigación inicial
Reward hackingEl agente maximiza una métrica sin cumplir la intenciónRevisar casos límite y varias señales de éxito
Exploración inseguraPrueba una acción peligrosa para aprenderSimulación, límites duros y política segura
Recompensa escasaLa señal útil llega muy tardeDiseño de currículo o señales auxiliares cuidadosas
Sobreajuste al simuladorFunciona en simulación y falla en el entorno realVariación del dominio y pruebas controladas
InestabilidadCambios pequeños producen políticas muy distintasVarias semillas, curvas y evaluación fuera de muestra
Coste de interacciónReunir episodios reales es lento o caroAprendizaje offline, simulación o método más simple

Una recompensa detallada puede acelerar el aprendizaje y, a la vez, introducir atajos inesperados. Antes de optimizarla, conviene escribir ejemplos de comportamiento deseado, indeseado y ambiguo, además de restricciones que nunca deben violarse.

Cómo evaluar un agente

No informes únicamente la recompensa de entrenamiento. Mide al menos:

  • retorno promedio y distribución entre episodios;
  • porcentaje de éxito y tasa de violaciones de seguridad;
  • rendimiento en escenarios no vistos;
  • cantidad de interacciones necesaria para aprender;
  • estabilidad entre semillas y versiones del entorno;
  • latencia, consumo y coste de inferencia;
  • degradación frente a cambios o perturbaciones.

La evaluación debe separar los datos usados para ajustar hiperparámetros de los escenarios reservados para la prueba final. También necesita una línea base: una regla sencilla o un método supervisado puede ser más fiable y barato.

Cuándo usar aprendizaje por refuerzo

Es una opción razonable cuando hay decisiones secuenciales, consecuencias diferidas, un entorno que puede simularse o medirse y suficientes interacciones seguras. Aparece en control, robótica, juegos, programación de recursos y optimización de políticas.

No suele ser la primera opción para clasificar datos independientes, ejecutar una regla conocida o resolver una tarea con pocas interacciones y alto riesgo. Si existe una etiqueta correcta por ejemplo, empieza por supervisado. Si una solución determinista satisface el objetivo, no necesitas que un agente descubra la regla por ensayo y error.

Fuentes primarias y técnicas

Preguntas frecuentes

¿Qué es el aprendizaje por refuerzo?
Es un paradigma en el que un agente aprende qué acciones tomar al interactuar con un entorno. Recibe recompensas y busca una política que maximice el retorno acumulado. A diferencia del aprendizaje supervisado, no necesita una respuesta correcta para cada decisión, pero sí una señal de objetivo bien diseñada.
¿Cuál es un ejemplo de aprendizaje por refuerzo?
Un ejemplo es un robot que aprende a mantener el equilibrio. Observa su posición, elige un movimiento, recibe una recompensa por avanzar sin caer y actualiza su política. También se usa en juegos, control industrial, asignación de recursos y algunos procesos de alineamiento de modelos.
¿Qué diferencia hay entre aprendizaje por refuerzo y aprendizaje supervisado?
El aprendizaje supervisado ajusta predicciones contra etiquetas conocidas y suele evaluar cada ejemplo por separado. El aprendizaje por refuerzo aprende de consecuencias que pueden aparecer más tarde: una acción cambia el entorno y afecta las decisiones siguientes, por lo que importa la secuencia y la recompensa acumulada.
¿Aprendizaje por refuerzo y RLHF son lo mismo?
No. El aprendizaje por refuerzo es el paradigma general. RLHF es una familia de técnicas para ajustar modelos a partir de retroalimentación humana, normalmente usando preferencias o un modelo de recompensa. Además, existen métodos de preferencia que no ejecutan un algoritmo de refuerzo clásico.

Términos relacionados

RLHF (Aprendizaje por refuerzo con retroalimentación humana)Método para alinear un modelo de lenguaje con las preferencias de las personas: humanos puntúan respuestas, se entrena un modelo de recompensa con esas preferencias y se ajusta el LLM mediante aprendizaje por refuerzo.Machine learning (Aprendizaje automático)Rama de la inteligencia artificial en la que un sistema aprende patrones a partir de datos en lugar de seguir reglas programadas a mano. Con suficientes ejemplos, el modelo generaliza y hace predicciones sobre datos nuevos.Agente de IAUn agente de IA es un sistema que usa un modelo para decidir y ejecutar los pasos de una tarea dentro de límites definidos. Recibe un objetivo, observa el estado, selecciona herramientas, actúa, comprueba el resultado y continúa, se detiene o solicita ayuda. A diferencia de un chatbot simple, puede modificar sistemas externos, por lo que necesita permisos, evaluaciones y supervisión proporcionales al riesgo.Modelos de razonamiento en IA: qué sonLos modelos de razonamiento son modelos de IA optimizados para dedicar cómputo adicional a resolver tareas complejas antes de producir una respuesta. Se usan en problemas de varios pasos, planificación, matemáticas, código y análisis de reglas. No garantizan exactitud, no necesitan mostrar su cadena interna y suelen intercambiar más latencia y coste por una mejor probabilidad de resolver tareas difíciles.Alineamiento (de IA)Conjunto de técnicas y objetivos para que un sistema de IA actúe conforme a los valores, intenciones y normas de las personas. Busca que el modelo sea útil, honesto y seguro.

02 / LLEVAR A LA PRÁCTICA

Después de leer

Convierte una idea útil en una habilidad repetible.

Elige una ruta breve, aplícala a una tarea real y termina con algo que puedas revisar, usar o compartir.

Hablar por WhatsApp