Saltar al contenido

Re-ranking: qué es y cómo funciona en RAG

El re-ranking, también escrito reranking o re ranking, es la segunda etapa de un sistema de búsqueda: recibe una lista corta de documentos recuperados y vuelve a puntuarlos con un modelo más preciso para colocar primero los más relevantes. En RAG suele combinar una recuperación rápida con embeddings o palabras clave y un reordenador más costoso antes de entregar contexto al LLM.

Actualizado: 13 de julio de 2026.

Cómo funciona el re-ranking paso a paso

Un sistema de recuperación a gran escala suele separar velocidad y precisión en dos etapas. Buscar con el modelo más costoso sobre todos los documentos sería lento; usar solo una similitud barata puede dejar resultados útiles demasiado abajo.

  1. Llega la consulta. El usuario formula una pregunta, por ejemplo: “¿cómo cancelo una suscripción anual?”.
  2. Recuperación inicial. BM25, un bi-encoder o una base de datos vectorial encuentra una lista de candidatos. Esta fase intenta no perder documentos relevantes.
  3. Nueva puntuación. El reranker recibe pares formados por la consulta y cada candidato, y produce una puntuación de relevancia más fina.
  4. Reordenamiento. Los candidatos se ordenan por esa nueva puntuación; no se crean documentos nuevos ni se amplía la colección.
  5. Selección final. El sistema muestra los primeros resultados o pasa unos pocos fragmentos al LLM de un sistema RAG.

El re-ranking solo puede promover documentos presentes en la lista inicial. Si la primera etapa no recupera el documento correcto, la segunda no puede inventarlo. Por eso el recall de candidatos sigue siendo una condición necesaria.

Ejemplo sencillo de dos etapas

Supón que la búsqueda inicial devuelve cinco fragmentos. La tabla es ilustrativa: las puntuaciones dependen del modelo y no se comparan entre proveedores.

CandidatoPosición inicialSeñal que detecta el rerankerPosición final
Política para cancelar el plan anual4Responde exactamente a la intención1
Cómo pausar una cuenta mensual1Tema relacionado, acción distinta2
Condiciones generales de facturación2Contiene palabras coincidentes, poca respuesta directa3
Renovación automática3Contexto útil, pero no explica la cancelación4
Crear una cuenta nueva5Irrelevante para la consulta5

La primera fase fue útil porque encontró la política correcta. El re-ranking corrigió su posición al comparar con más detalle la intención de la consulta y el contenido del fragmento.

Búsqueda inicial vs. re-ranking

AspectoRecuperación inicialRe-ranking
AlcanceColección completa o índice grandeLista corta de candidatos
ObjetivoRecuperar rápido sin perder resultados útilesMejorar el orden de los candidatos
Métodos habitualesBM25, búsqueda vectorial, bi-encoderCross-encoder, interacción tardía o modelos generativos
RepresentaciónConsulta y documentos suelen indexarse por separadoPuede analizar la consulta junto a cada documento
CosteBajo por documento y escalableMayor por candidato; depende del tamaño de la lista
Fallo característicoEl documento relevante no entra en candidatosEl documento está, pero recibe una puntuación incorrecta

Un bi-encoder genera por separado el embedding de la consulta y el de cada documento. Eso permite precalcular e indexar documentos. Un cross-encoder introduce juntos consulta y documento en el transformer y genera una puntuación para ese par. La documentación de Sentence Transformers resume el intercambio: el cross-encoder suele rendir mejor en pares predefinidos, pero no escala igual sobre colecciones completas.

Cross-encoder, interacción tardía y reranker generativo

No todos los reordenadores tienen la misma arquitectura:

  • Cross-encoder: procesa conjuntamente cada par consulta-documento. El trabajo de Nogueira y Cho aplicó BERT al re-ranking de pasajes y reportó, en su configuración de MS MARCO, una mejora relativa del 27 % en MRR@10 frente al estado del arte anterior. Ese resultado pertenece a aquel benchmark; no es una promesa universal.
  • Interacción tardía: codifica consulta y documentos por separado, pero conserva representaciones por token para hacer una interacción más rica al final. ColBERT propuso este punto intermedio para reducir el coste de modelos BERT de ranking y permitir precalcular documentos.
  • Reranker generativo o basado en LLM: puede puntuar, comparar o devolver un orden mediante instrucciones. Ofrece flexibilidad, pero añade coste, latencia y riesgo de variación; requiere validación consistente del formato y de la calidad.

La elección depende del idioma, dominio, longitud de los textos, hardware, volumen de consultas y tolerancia a latencia. Un modelo excelente en inglés general puede ordenar peor documentos jurídicos o técnicos en español si no fue entrenado o evaluado para ese contexto.

Qué aporta el re-ranking a un sistema RAG

En RAG, los primeros fragmentos suelen entrar en una ventana de contexto limitada. Mejorar su orden puede:

  • colocar evidencia directamente relacionada con la pregunta antes que coincidencias superficiales;
  • reducir contexto irrelevante que distrae al modelo generador;
  • aprovechar mejor un límite pequeño de fragmentos o tokens;
  • mejorar la trazabilidad si las citas se construyen a partir de los candidatos finales.

Sin embargo, el re-ranking no elimina las alucinaciones. No verifica por sí mismo que una fuente sea verdadera, reciente o autorizada. Tampoco resuelve una fragmentación deficiente, permisos incorrectos, preguntas ambiguas ni un LLM que ignora el contexto. Es una mejora de recuperación, no una garantía de veracidad.

Cómo elegir el número de candidatos

Hay dos controles diferentes:

  • top-N de recuperación: cuántos candidatos recibe el reranker;
  • top-K final: cuántos resultados se muestran o pasan al LLM.

Aumentar N puede rescatar documentos que aparecían abajo, pero multiplica el número de pares que debe puntuar un cross-encoder. Aumentar K aporta más contexto, aunque también puede introducir ruido y consumir tokens. El valor correcto se obtiene midiendo consultas reales, no copiando un número fijo de un tutorial.

Una estrategia práctica es empezar con un conjunto de evaluación que incluya preguntas, documentos relevantes y respuestas esperadas. Después se prueban varias combinaciones de N y K bajo un presupuesto de latencia. También conviene separar consultas simples, ambiguas y sin respuesta, porque sus fallos son distintos.

Métricas para saber si funciona

MétricaQué mideEn qué etapa ayuda
Recall@NSi al menos un documento relevante entró en los N candidatosRecuperación inicial
MRR@KQué tan pronto aparece el primer resultado relevanteOrden de resultados
nDCG@KCalidad del orden cuando existen varios grados de relevanciaRe-ranking
Precision@KProporción de resultados relevantes entre los K primerosLista final
Latencia p95Tiempo de respuesta en consultas lentasOperación real
Exactitud y fidelidad de la respuestaSi el LLM responde correctamente y se apoya en la evidenciaSistema RAG completo

BEIR reúne conjuntos de datos heterogéneos para evaluar recuperación fuera del dominio de entrenamiento. Su lección práctica es importante: un resultado alto en un único benchmark no demuestra generalización a todos los dominios. Para un producto real, las métricas offline deben acompañarse de evaluación humana, errores por tipo de consulta y pruebas de extremo a extremo.

Errores frecuentes

  • Evaluar solo el reranker. Si Recall@N es bajo, primero hay que mejorar indexación, embeddings, filtros o recuperación híbrida.
  • Enviar demasiados candidatos. Puede aumentar latencia sin mejorar la lista final.
  • Ignorar el idioma y el dominio. La relevancia debe probarse con el vocabulario real de los usuarios.
  • Confundir puntuaciones con probabilidades. Muchos scores solo sirven para ordenar dentro de una consulta y no tienen un umbral universal.
  • Medir solo clics. En RAG también importa si la respuesta usa el fragmento correcto y cita la evidencia adecuada.
  • Prometer ausencia de alucinaciones. Un ranking mejor reduce una fuente de error, pero no controla todo el proceso generativo.

Para aprender a integrar búsqueda, automatización y modelos generativos en flujos reales, consulta la ruta de fundamentos de inteligencia artificial.

Fuentes primarias y documentación técnica

Preguntas frecuentes

¿Qué es el re-ranking en inteligencia artificial?
Es una segunda evaluación de resultados ya recuperados. Un buscador rápido genera candidatos y un modelo de ranking vuelve a puntuar cada par consulta-documento para ordenar esa lista con más precisión antes de mostrarla o usarla como contexto de un LLM.
¿Qué diferencia hay entre búsqueda vectorial y re-ranking?
La búsqueda vectorial compara embeddings y puede recorrer un índice grande con rapidez. El re-ranking trabaja sobre una lista mucho menor y puede analizar conjuntamente la consulta y cada documento. Son etapas complementarias: recuperar candidatos y después reordenarlos.
¿El re-ranking elimina las alucinaciones de un sistema RAG?
No. Puede mejorar la relevancia del contexto y reducir errores causados por una mala ordenación, pero no corrige documentos falsos, información ausente, instrucciones defectuosas ni todos los fallos de generación del LLM. La respuesta final debe evaluarse por separado.
¿Cuántos documentos se deben enviar al reranker?
No existe un número universal. Una lista más amplia puede aumentar el recall, pero también eleva latencia y coste. Conviene medir recall de la primera etapa, nDCG o MRR después del re-ranking y calidad de respuesta de extremo a extremo con consultas reales.

Términos relacionados

Búsqueda semánticaForma de búsqueda que encuentra resultados por significado y no por coincidencia exacta de palabras. Usa embeddings para entender la intención, de modo que 'darme de baja' y 'cancelar suscripción' devuelven lo mismo.RAG (generación aumentada por recuperación)RAG es una arquitectura de inteligencia artificial que recupera información relevante desde documentos, bases de datos u otras fuentes externas y la añade al contexto de un modelo de lenguaje antes de generar una respuesta. Permite trabajar con conocimiento privado o reciente sin reentrenar los pesos del modelo.Base de datos vectorial: qué es y cómo funcionaUna base de datos vectorial es un sistema que almacena embeddings junto con identificadores y metadatos, construye un índice para buscar vecinos cercanos y devuelve elementos semánticamente similares a un vector de consulta. Puede ser un producto especializado o una capacidad añadida a un buscador o base tradicional; guardar vectores no basta sin estrategia de recuperación, filtros y evaluación.Incrustación vectorial (embedding)Una incrustación vectorial o embedding es una representación numérica de un texto, imagen, audio u otro dato que conserva relaciones de significado. Un modelo convierte cada elemento en un vector; los vectores semánticamente parecidos quedan próximos en el espacio matemático. Esa propiedad permite buscar por significado, recomendar contenido, agrupar ejemplos y recuperar contexto para sistemas RAG sin depender solo de palabras exactas.Fragmentación (chunking)Proceso de dividir documentos largos en fragmentos más pequeños antes de convertirlos en embeddings. Una buena estrategia de chunking es clave para que un sistema RAG recupere contexto preciso.

02 / LLEVAR A LA PRÁCTICA

Después de leer

Convierte una idea útil en una habilidad repetible.

Elige una ruta breve, aplícala a una tarea real y termina con algo que puedas revisar, usar o compartir.

Hablar por WhatsApp