O método eval
O método eval
Uma filosofia breve, seguida de quatro guias aprofundados. Todo o método se resume a uma ideia: substituir opiniões sobre a qualidade da IA por pontuações calculadas a partir de comandos reais.
#As quatro peças móveis
- Um golden set — entradas reais pareadas com saídas combinadas como corretas, versionado junto ao código. Esta é a fonte da verdade.
- Um juiz — um modelo de avaliação (ou uma verificação determinística) que pontua cada saída quanto à fidelidade, relevância e segurança.
- Sondas de segurança — entradas adversariais que tentam quebrar a funcionalidade da forma como um usuário real ou um invasor faria.
- Um CI gate — a suíte roda a cada mudança; uma pontuação abaixo do piso mínimo, que só sobe, bloqueia o merge.
#Os princípios
- Calculado, não afirmado. Uma pontuação vem de um comando que qualquer pessoa pode executar novamente — nunca de uma opinião.
- Que suba, não que apenas passe. O piso só pode subir, para que a qualidade não se corroa silenciosamente com o tempo.
- Reduza a revisão humana com evidências. Comece com um humano no circuito; remova pontos de aprovação somente quando os evals provarem que é seguro.
- Nada de verde falso. Se o gate deveria estar vermelho, ele fica vermelho — publicamente. (O próprio placar deste site funciona da mesma forma.)
▸
Aprofundamentos, cada um com um diagrama animado: O CI eval gate · Sondas de segurança · Golden sets e juízes · Aprovação humana.
Veja em ação
O eval ao vivo avalia uma IA em tempo real — aperte executar e veja ela falhar nas sondas.
© 2026 Jason Teixeira · Sage Ideas LLC · Início da documentação