Saltar al contenido

Mezcla de expertos (MoE): qué es y cómo funciona

La mezcla de expertos o Mixture of Experts (MoE) es una arquitectura de red neuronal en la que un enrutador elige qué subredes, llamadas expertos, procesan cada entrada o token. En una MoE dispersa solo se activa una parte de los parámetros por token, lo que aumenta la capacidad total sin usar toda la red en cada cálculo, aunque añade costes de memoria, comunicación y balanceo.

Actualizado: 13 de julio de 2026.

Cómo funciona una mezcla de expertos paso a paso

En muchos transformers, una capa densa aplica la misma red feed-forward a todos los tokens. Una capa MoE sustituye esa parte por varias redes feed-forward y un router entrenable:

  1. Representación del token: el transformer produce un vector para el token actual.
  2. Puntuación del router: una pequeña red asigna una puntuación a cada experto disponible.
  3. Selección top-k: el sistema elige el experto con mayor puntuación o los pocos mejor puntuados, según el diseño.
  4. Procesamiento especializado: solo los expertos seleccionados transforman el vector del token.
  5. Combinación: las salidas se ponderan y vuelven al flujo normal del transformer.

La selección puede cambiar en cada capa y para cada token. Por eso una oración no se envía completa a un único experto permanente. Tampoco significa que cada experto sea un modelo conversacional independiente: normalmente es una subred dentro de capas concretas de un modelo entrenado de extremo a extremo.

Ejemplo real: Mixtral 8x7B

El artículo técnico de Mixtral describe ocho bloques feed-forward por capa y un router que selecciona dos para cada token. El modelo tiene alrededor de 47.000 millones de parámetros totales y usa unos 13.000 millones de parámetros activos por token, según sus autores.

La notación 8x7B no debe interpretarse como ocho modelos completos de 7.000 millones que siempre se ejecutan juntos. Parte de los parámetros se comparte fuera de los expertos y solo dos expertos participan en cada capa MoE. El ejemplo demuestra la diferencia entre parámetros totales, que influyen en almacenamiento y memoria, y parámetros activos, que influyen directamente en el cálculo de cada token.

Modelo denso vs. MoE vs. ensemble

ArquitecturaQué se activa por entradaCómo se entrenaCoste característico
Modelo densoLa misma ruta de parámetros para todos los tokensUn solo modelo de extremo a extremoCálculo predecible; cada parámetro de la capa participa
MoE dispersaUno o pocos expertos por token, más las capas compartidasRouter y expertos se entrenan juntosMenos cálculo que activar todos los expertos, pero más memoria y comunicación
EnsembleVarios modelos completos, normalmente todos o varios por consultaCada modelo puede entrenarse por separadoSuma el coste de ejecutar y combinar múltiples modelos

Una MoE no es simplemente un ensemble barato. La decisión de enrutamiento ocurre dentro de la red, a menudo en varias capas, y forma parte del aprendizaje del modelo.

Ventajas y costes de una arquitectura MoE

AspectoVentaja posibleCoste o riesgo
CapacidadAñadir parámetros sin activarlos todos para cada tokenLos pesos totales siguen ocupando almacenamiento y memoria
Cálculo por tokenMantener pocos expertos activosEl router y la combinación también consumen recursos
EspecializaciónDiferentes subredes pueden aprender patrones distintosLa especialización puede ser difícil de interpretar o medir
Escalado distribuidoRepartir expertos entre aceleradoresEnviar tokens entre dispositivos añade comunicación y latencia
EntrenamientoAumentar capacidad con cómputo activo controladoPuede haber inestabilidad, expertos sobrecargados o expertos casi sin uso

El trabajo de Switch Transformers documenta precisamente esos obstáculos: complejidad, comunicación y estabilidad. Su propuesta simplificó el router para enviar cada token a un solo experto y usó técnicas de entrenamiento para mejorar el balance y la estabilidad. Los resultados de un artículo concreto no garantizan la misma mejora en cualquier arquitectura, conjunto de datos o infraestructura.

Qué significa el balance de carga

Si el router manda demasiados tokens al mismo experto, ese experto puede superar su capacidad mientras otros quedan infrautilizados. Los sistemas MoE suelen añadir pérdidas auxiliares, límites de capacidad u otras reglas para repartir trabajo.

Cuando un experto alcanza el límite, la implementación puede descartar, redirigir o procesar de otra forma los tokens excedentes. Esa decisión afecta calidad y rendimiento. Por eso comparar solo el número de parámetros activos oculta una parte importante del coste real de servir el modelo.

Errores frecuentes al hablar de MoE

  • “Cada experto domina una materia”. Puede aparecer especialización, pero no se debe asignar una etiqueta temática sin medir el comportamiento interno.
  • “Los parámetros inactivos no ocupan memoria”. No participan en ese cálculo, pero sus pesos deben almacenarse y estar disponibles.
  • “MoE siempre es más rápido”. Depende del hardware, el tamaño del lote, el router, la distribución de expertos y el coste de comunicación.
  • “Más parámetros totales implica mejor calidad”. La calidad depende también de datos, entrenamiento, arquitectura, alineamiento y evaluación.
  • “Un usuario elige manualmente al experto”. En la forma habitual, el router aprende la selección y la ejecuta por token sin una elección explícita del usuario.

Para situar esta arquitectura dentro del panorama general, consulta qué es un LLM, cómo funciona un transformer y la ruta de fundamentos de inteligencia artificial.

Fuentes primarias

Preguntas frecuentes

¿Qué es una mezcla de expertos (MoE)?
Una mezcla de expertos es una arquitectura que contiene varias subredes y un mecanismo de enrutamiento. En una MoE dispersa, el router selecciona uno o pocos expertos para cada entrada o token; sus salidas se combinan y el resto de expertos no participa en ese cálculo concreto.
¿Los expertos de un modelo MoE dominan temas distintos?
No necesariamente de una forma clara para una persona. Los expertos pueden aprender patrones diferentes, pero el entrenamiento no garantiza que uno sea el experto en código y otro el experto en historia. La especialización debe medirse; el nombre experto describe una subred, no un rol humano predefinido.
¿Una MoE usa menos memoria porque activa pocos parámetros?
No en la misma proporción. Activar pocos expertos reduce el cálculo por token, pero todos los pesos deben almacenarse y estar disponibles en memoria local o distribuida. Además, mover tokens entre dispositivos y equilibrar la carga puede añadir latencia y coste de comunicación.

Términos relacionados

02 / LLEVAR A LA PRÁCTICA

Después de leer

Convierte una idea útil en una habilidad repetible.

Elige una ruta breve, aplícala a una tarea real y termina con algo que puedas revisar, usar o compartir.

Hablar por WhatsApp