Explicabilidad en IA (XAI): qué es
La explicabilidad en inteligencia artificial o XAI es la capacidad de un sistema para aportar razones o evidencia comprensibles sobre una salida, junto con información sobre sus límites. Una explicación útil debe responder a una audiencia y propósito concretos; no basta con producir una historia plausible, porque también debe representar con fidelidad el comportamiento que pretende explicar.
Actualizado: 13 de julio de 2026.
Qué debe aportar una explicación de IA
Una explicación de IA debería ayudar a una persona concreta a tomar una decisión concreta sin atribuir al modelo una certeza que no tiene. No existe una explicación universal: un desarrollador necesita señales de depuración; una persona afectada quiere conocer factores relevantes y opciones; un auditor necesita evidencia reproducible y límites.
El informe Four Principles of Explainable Artificial Intelligence de NIST propone cuatro principios para sistemas que deban ser explicables:
- Explicación: el sistema aporta razones o evidencia para sus salidas o procesos.
- Significativa: la explicación es comprensible para el destinatario previsto.
- Exactitud de la explicación: refleja correctamente el proceso o la razón que afirma explicar.
- Límites de conocimiento: el sistema identifica condiciones fuera de su diseño o confianza suficiente.
Estos principios separan dos ideas que suelen confundirse: que una explicación suene clara y que sea fiel. Una frase sencilla pero inventada por un modelo puede ser comprensible y, aun así, no representar la causa de la salida.
Explicabilidad vs. interpretabilidad
Los campos académico, técnico y regulatorio no usan siempre las palabras de la misma manera. Una distinción práctica es:
| Concepto | Pregunta | Ejemplo |
|---|---|---|
| Interpretabilidad intrínseca | ¿Puede entenderse directamente cómo produce la salida? | Árbol de decisión pequeño |
| Explicabilidad post hoc | ¿Puede generarse una representación útil después de predecir? | Importancia local de variables |
| Transparencia | ¿Se documentan datos, diseño, responsables y uso? | Ficha del modelo y procedencia de datos |
| Justificación | ¿Por qué la organización considera aceptable la decisión? | Política y revisión humana |
| Causalidad | ¿Qué intervención cambiaría realmente el resultado? | Ensayo o modelo causal validado |
Una importancia de variables no es necesariamente una explicación causal. Si “código postal” contribuye a una predicción, cambiar ese valor en una tabla no demuestra que mudarse causaría el resultado deseado. Puede ser una variable correlacionada con otros factores.
Tipos de explicación
Local y global
Una explicación local describe una predicción específica: por qué este caso recibió cierta puntuación. Una explicación global intenta resumir el comportamiento general del modelo: qué patrones usa a través de muchos casos. Varias explicaciones locales no forman automáticamente una explicación global representativa.
Intrínseca y post hoc
Un modelo intrínsecamente interpretable restringe su estructura para que pueda examinarse directamente. Una técnica post hoc analiza un modelo ya entrenado, incluso si es una red neuronal compleja. El método post hoc no abre literalmente una “caja negra”; construye una aproximación o atribución que debe validarse.
Específica y agnóstica al modelo
Algunos métodos usan gradientes, atención o estructura interna y solo funcionan con ciertas arquitecturas. Otros tratan el modelo como una función a la que pueden consultar, por lo que son agnósticos. Ser agnóstico amplía la compatibilidad, pero puede requerir muchas consultas y perder detalles internos.
Basada en ejemplos, reglas o atribuciones
Una explicación puede mostrar casos similares, un contrafactual, una regla, un prototipo, una visualización o el peso atribuido a cada entrada. El formato debería corresponder a la pregunta, no solo a la herramienta disponible.
Métodos comunes de XAI
| Método | Qué produce | Útil para | Límite principal |
|---|---|---|---|
| Importancia por permutación | Caída de rendimiento al alterar una variable | Visión global | Variables correlacionadas confunden la atribución |
| LIME | Modelo simple alrededor de un caso | Explicación local agnóstica | Depende del muestreo y vecindario elegidos |
| SHAP | Contribuciones según un marco de valores de Shapley | Atribución local y resúmenes | Referencia y dependencias cambian el resultado |
| PDP | Efecto promedio al variar una característica | Tendencia global | Puede crear combinaciones irreales |
| ICE | Curvas por individuo | Heterogeneidad entre casos | Se vuelve difícil de leer a gran escala |
| Contrafactual | Cambio mínimo que altera la salida | Recurrencia y acción | Puede ser inviable o no causal |
| Saliency map | Zonas de entrada asociadas a la salida | Imágenes o secuencias | Sensible al método y a perturbaciones |
| Reglas o árbol sustituto | Aproximación interpretable del modelo | Resumen operativo | La aproximación puede tener baja fidelidad |
El trabajo original de LIME explica predicciones aproximando el modelo en la vecindad del caso. SHAP unifica métodos de atribución aditiva mediante valores de Shapley. Ambos marcos aportan herramientas útiles, no certificados de verdad causal.
Ejemplo: explicar una decisión de crédito
Supón que un modelo estima riesgo de impago. Una salida responsable podría incluir:
- puntuación y rango de incertidumbre;
- factores que más influyeron en este caso;
- fuente y fecha de los datos usados;
- comparación con un grupo de referencia apropiado;
- condiciones en las que el modelo no fue validado;
- canal para corregir datos y solicitar revisión;
- advertencia de que una atribución estadística no demuestra causalidad.
Decir “la IA decidió porque su puntuación fue 0,71” no explica nada: solo repite la salida. Tampoco basta con generar una frase mediante un LLM si esa frase no está vinculada a evidencia calculada y comprobable.
Cómo evaluar una explicación
Evalúa el artefacto explicativo por separado del modelo predictivo:
- Fidelidad: ¿representa el comportamiento del modelo en la región que afirma explicar?
- Estabilidad: ¿casos muy parecidos producen explicaciones razonablemente parecidas?
- Sensibilidad: ¿cambia cuando una variable realmente relevante cambia?
- Comprensibilidad: ¿el público objetivo interpreta correctamente el mensaje?
- Utilidad: ¿permite detectar un error, impugnar una decisión o actuar mejor?
- Cobertura: ¿se explica la mayoría de los casos o solo ejemplos favorables?
- Robustez: ¿puede manipularse la entrada sin alterar la predicción para obtener otra explicación?
- Reproducibilidad: ¿quedan registrados modelo, versión, datos de referencia y parámetros?
La comprensión se prueba con personas del público real, no con la opinión del equipo que creó el gráfico. Una explicación más corta puede ser mejor para una persona usuaria y demasiado superficial para un auditor; pueden coexistir varias capas enlazadas a la misma evidencia.
Explicaciones en modelos generativos
Un modelo generativo puede redactar una justificación fluida que no corresponda a su proceso interno. Pedir “explica paso a paso por qué respondiste” obtiene texto generado, no acceso garantizado a estados internos ni una traza causal.
Para sistemas con LLM, es más verificable exponer:
- documentos recuperados y fragmentos citados;
- llamadas a herramientas y resultados autorizados;
- reglas deterministas aplicadas;
- puntuaciones de verificadores externos;
- versión del prompt, modelo y fuentes;
- incertidumbre, abstención y límites de uso.
La trazabilidad de evidencia suele ser más accionable que una historia sobre lo que el modelo “pensó”. En tareas críticas, una explicación generada debe comprobarse contra registros del sistema.
Errores frecuentes
- Confundir plausibilidad con fidelidad: una explicación puede sonar bien y ser falsa.
- Tomar correlación como causalidad: una atribución no prueba qué intervención funcionará.
- Ocultar incertidumbre: mostrar un orden exacto de factores sin estabilidad o intervalos.
- Usar un solo método: técnicas diferentes pueden revelar supuestos distintos.
- Explicar solo casos exitosos: la cobertura real incluye errores y grupos minoritarios.
- Publicar datos sensibles: una explicación puede filtrar atributos o información de entrenamiento.
- Sustituir responsabilidad: la organización sigue siendo responsable de la decisión y del recurso disponible.
Explicabilidad, ética y confianza
La explicabilidad ayuda a investigar sesgo algorítmico, errores y usos fuera de alcance, pero no garantiza una IA responsable. NIST incluye explicabilidad e interpretabilidad dentro de un conjunto más amplio de características de confianza: validez, fiabilidad, seguridad, resiliencia, transparencia, privacidad y equidad también requieren controles propios.
Los requisitos concretos dependen del contexto, riesgo y jurisdicción. Antes de desplegar, documenta quién necesita la explicación, para qué decisión, con qué evidencia, qué puede impugnar y quién responde cuando el sistema falla.
Lista práctica para una auditoría XAI
- definir audiencia, propósito y decisión afectada;
- documentar qué parte se explica: datos, modelo, salida o proceso organizativo;
- elegir método y datos de referencia antes de mirar el resultado deseado;
- medir fidelidad, estabilidad, cobertura y comprensión;
- contrastar con al menos una técnica o prueba independiente;
- mostrar límites, incertidumbre y casos de abstención;
- conservar versiones y evidencia reproducible;
- ofrecer revisión y corrección cuando una persona pueda verse afectada.
Fuentes primarias y oficiales
- NISTIR 8312 — Four Principles of Explainable Artificial Intelligence.
- Ribeiro, Singh y Guestrin — Why Should I Trust You? (LIME).
- Lundberg y Lee — A Unified Approach to Interpreting Model Predictions (SHAP).
- NIST AI Risk Management Framework.
Preguntas frecuentes
- ¿Qué es la explicabilidad en inteligencia artificial?
- Es la capacidad de un sistema de IA para ofrecer razones o evidencia comprensibles sobre una salida y comunicar sus límites. La explicación debe adaptarse a quien la recibe y ser fiel al comportamiento explicado; una narración convincente, por sí sola, no demuestra por qué el modelo decidió.
- ¿Cuál es la diferencia entre explicabilidad e interpretabilidad?
- No existe una terminología universal. A menudo, interpretabilidad describe cuánto puede una persona entender directamente el funcionamiento o significado de un modelo, mientras explicabilidad incluye técnicas y artefactos que ayudan a explicar sistemas complejos. Conviene definir ambos términos en cada proyecto en lugar de tratarlos como métricas automáticas.
- ¿SHAP y LIME explican realmente una predicción?
- Aportan explicaciones post hoc bajo supuestos concretos. LIME aproxima localmente el modelo y SHAP asigna contribuciones basadas en valores de Shapley. Son útiles para investigar, pero pueden variar con la configuración, los datos de referencia y las dependencias entre variables; no prueban causalidad ni sustituyen la validación.
- ¿Una IA explicable es automáticamente confiable y sin sesgos?
- No. La explicabilidad es una propiedad importante, pero no garantiza precisión, equidad, privacidad, seguridad ni robustez. Una explicación puede revelar un problema o incluso ocultarlo si es infiel. La confianza exige pruebas independientes del modelo, los datos, la explicación y el impacto real.