Cinco cosas, o estás adivinando.
Un arnés de evaluación de RAG con aprobado/reprobado tiene que puntuar las cinco sobre un conjunto de preguntas fijo — idealmente un conjunto de referencia con fuentes correctas conocidas — y bloquear el lanzamiento según los resultados. Omita una y habrá dejado toda una clase de fallos sin probar.
- 01Cobertura de citas. ¿Qué fracción de las afirmaciones de la respuesta lleva una cita que realmente las respalda? No «tiene una nota al pie» — el fragmento citado debe contener la afirmación. Objetivo: que cada frase de peso sea rastreable hasta una fuente recuperada.
- 02Precisión y exhaustividad de la recuperación. ¿El recuperador trajo los fragmentos que contienen la respuesta (exhaustividad) y cuánto ruido vino con ellos (precisión)? Un generador perfecto no puede salvar a un recuperador que nunca trajo el pasaje correcto.
- 03Fundamentación / fidelidad. ¿Cada afirmación se deriva del contexto recuperado, o el modelo añadió «conocimiento» del preentrenamiento que no está en las fuentes? Aquí es donde se esconde la alucinación incluso cuando hay citas.
- 04Abstención cuando no hay evidencia. Cuando el corpus genuinamente no contiene la respuesta, ¿el sistema lo dice — o fabula? Pruébelo con preguntas fuera del corpus y exija una respuesta explícita de «evidencia insuficiente».
- 05Latencia y costo por consulta. Recuperación + reordenamiento + generación suman milisegundos y tokens cada uno. Mide la latencia p50/p95 y el costo por consulta, porque un sistema preciso que nadie puede permitirse ejecutar sigue siendo un sistema fallido.