Mezcla de expertos (MoE): qué es y cómo funciona
La mezcla de expertos o Mixture of Experts (MoE) es una arquitectura de red neuronal en la que un enrutador elige qué subredes, llamadas expertos, procesan cada entrada o token. En una MoE dispersa solo se activa una parte de los parámetros por token, lo que aumenta la capacidad total sin usar toda la red en cada cálculo, aunque añade costes de memoria, comunicación y balanceo.
Actualizado: 13 de julio de 2026.
Cómo funciona una mezcla de expertos paso a paso
En muchos transformers, una capa densa aplica la misma red feed-forward a todos los tokens. Una capa MoE sustituye esa parte por varias redes feed-forward y un router entrenable:
- Representación del token: el transformer produce un vector para el token actual.
- Puntuación del router: una pequeña red asigna una puntuación a cada experto disponible.
- Selección top-k: el sistema elige el experto con mayor puntuación o los pocos mejor puntuados, según el diseño.
- Procesamiento especializado: solo los expertos seleccionados transforman el vector del token.
- Combinación: las salidas se ponderan y vuelven al flujo normal del transformer.
La selección puede cambiar en cada capa y para cada token. Por eso una oración no se envía completa a un único experto permanente. Tampoco significa que cada experto sea un modelo conversacional independiente: normalmente es una subred dentro de capas concretas de un modelo entrenado de extremo a extremo.
Ejemplo real: Mixtral 8x7B
El artículo técnico de Mixtral describe ocho bloques feed-forward por capa y un router que selecciona dos para cada token. El modelo tiene alrededor de 47.000 millones de parámetros totales y usa unos 13.000 millones de parámetros activos por token, según sus autores.
La notación 8x7B no debe interpretarse como ocho modelos completos de 7.000 millones que siempre se ejecutan juntos. Parte de los parámetros se comparte fuera de los expertos y solo dos expertos participan en cada capa MoE. El ejemplo demuestra la diferencia entre parámetros totales, que influyen en almacenamiento y memoria, y parámetros activos, que influyen directamente en el cálculo de cada token.
Modelo denso vs. MoE vs. ensemble
| Arquitectura | Qué se activa por entrada | Cómo se entrena | Coste característico |
|---|---|---|---|
| Modelo denso | La misma ruta de parámetros para todos los tokens | Un solo modelo de extremo a extremo | Cálculo predecible; cada parámetro de la capa participa |
| MoE dispersa | Uno o pocos expertos por token, más las capas compartidas | Router y expertos se entrenan juntos | Menos cálculo que activar todos los expertos, pero más memoria y comunicación |
| Ensemble | Varios modelos completos, normalmente todos o varios por consulta | Cada modelo puede entrenarse por separado | Suma el coste de ejecutar y combinar múltiples modelos |
Una MoE no es simplemente un ensemble barato. La decisión de enrutamiento ocurre dentro de la red, a menudo en varias capas, y forma parte del aprendizaje del modelo.
Ventajas y costes de una arquitectura MoE
| Aspecto | Ventaja posible | Coste o riesgo |
|---|---|---|
| Capacidad | Añadir parámetros sin activarlos todos para cada token | Los pesos totales siguen ocupando almacenamiento y memoria |
| Cálculo por token | Mantener pocos expertos activos | El router y la combinación también consumen recursos |
| Especialización | Diferentes subredes pueden aprender patrones distintos | La especialización puede ser difícil de interpretar o medir |
| Escalado distribuido | Repartir expertos entre aceleradores | Enviar tokens entre dispositivos añade comunicación y latencia |
| Entrenamiento | Aumentar capacidad con cómputo activo controlado | Puede haber inestabilidad, expertos sobrecargados o expertos casi sin uso |
El trabajo de Switch Transformers documenta precisamente esos obstáculos: complejidad, comunicación y estabilidad. Su propuesta simplificó el router para enviar cada token a un solo experto y usó técnicas de entrenamiento para mejorar el balance y la estabilidad. Los resultados de un artículo concreto no garantizan la misma mejora en cualquier arquitectura, conjunto de datos o infraestructura.
Qué significa el balance de carga
Si el router manda demasiados tokens al mismo experto, ese experto puede superar su capacidad mientras otros quedan infrautilizados. Los sistemas MoE suelen añadir pérdidas auxiliares, límites de capacidad u otras reglas para repartir trabajo.
Cuando un experto alcanza el límite, la implementación puede descartar, redirigir o procesar de otra forma los tokens excedentes. Esa decisión afecta calidad y rendimiento. Por eso comparar solo el número de parámetros activos oculta una parte importante del coste real de servir el modelo.
Errores frecuentes al hablar de MoE
- “Cada experto domina una materia”. Puede aparecer especialización, pero no se debe asignar una etiqueta temática sin medir el comportamiento interno.
- “Los parámetros inactivos no ocupan memoria”. No participan en ese cálculo, pero sus pesos deben almacenarse y estar disponibles.
- “MoE siempre es más rápido”. Depende del hardware, el tamaño del lote, el router, la distribución de expertos y el coste de comunicación.
- “Más parámetros totales implica mejor calidad”. La calidad depende también de datos, entrenamiento, arquitectura, alineamiento y evaluación.
- “Un usuario elige manualmente al experto”. En la forma habitual, el router aprende la selección y la ejecuta por token sin una elección explícita del usuario.
Para situar esta arquitectura dentro del panorama general, consulta qué es un LLM, cómo funciona un transformer y la ruta de fundamentos de inteligencia artificial.
Fuentes primarias
- Shazeer et al., “Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer” (2017).
- Fedus, Zoph y Shazeer, “Switch Transformers” (JMLR, 2022).
- Jiang et al., “Mixtral of Experts” (2024).
- Zhou et al., “Mixture-of-Experts with Expert Choice Routing” (NeurIPS, 2022).
Preguntas frecuentes
- ¿Qué es una mezcla de expertos (MoE)?
- Una mezcla de expertos es una arquitectura que contiene varias subredes y un mecanismo de enrutamiento. En una MoE dispersa, el router selecciona uno o pocos expertos para cada entrada o token; sus salidas se combinan y el resto de expertos no participa en ese cálculo concreto.
- ¿Los expertos de un modelo MoE dominan temas distintos?
- No necesariamente de una forma clara para una persona. Los expertos pueden aprender patrones diferentes, pero el entrenamiento no garantiza que uno sea el experto en código y otro el experto en historia. La especialización debe medirse; el nombre experto describe una subred, no un rol humano predefinido.
- ¿Una MoE usa menos memoria porque activa pocos parámetros?
- No en la misma proporción. Activar pocos expertos reduce el cálculo por token, pero todos los pesos deben almacenarse y estar disponibles en memoria local o distribuida. Además, mover tokens entre dispositivos y equilibrar la carga puede añadir latencia y coste de comunicación.