Cinco coisas, ou você está chutando.
Uma bateria de avaliação de RAG com resultado aprovado/reprovado precisa pontuar todas as cinco em um conjunto fixo de perguntas — idealmente um golden set com fontes corretas conhecidas — e bloquear a release com base nos resultados. Pule uma e você deixou uma classe inteira de falhas sem teste.
- 01Cobertura de citações. Que fração das afirmações da resposta carrega uma citação que realmente as sustenta? Não "tem uma nota de rodapé" — o trecho citado precisa conter a afirmação. Meta: toda frase que sustenta a resposta é rastreável até uma fonte recuperada.
- 02Precisão e recall de recuperação. O retriever trouxe os trechos que contêm a resposta (recall) e quanto ruído veio junto (precisão)? Um gerador perfeito não salva um retriever que nunca buscou a passagem certa.
- 03Fundamentação / fidelidade. Cada afirmação é acarretada pelo contexto recuperado, ou o modelo acrescentou "conhecimento" do pré-treinamento que não está nas fontes? É aqui que a alucinação se esconde mesmo quando há citações presentes.
- 04Abster-se quando não há evidência. Quando o corpus genuinamente não contém a resposta, o sistema diz isso — ou inventa? Teste com perguntas fora do corpus e exija uma resposta explícita de "evidência insuficiente".
- 05Latência e custo por consulta. Recuperação + rerank + geração somam milissegundos e tokens cada um. Meça a latência p50/p95 e o custo por consulta, porque um sistema preciso que ninguém consegue pagar para rodar ainda é um sistema que falhou.