EN·ES·PT
JTjason.teixeira() Docs
serviços Agendar uma chamada →
Início / Docs / O método eval / O método eval
O método eval

O método eval

Uma filosofia breve, seguida de quatro guias aprofundados. Todo o método se resume a uma ideia: substituir opiniões sobre a qualidade da IA por pontuações calculadas a partir de comandos reais.

#As quatro peças móveis

  1. Um golden set — entradas reais pareadas com saídas combinadas como corretas, versionado junto ao código. Esta é a fonte da verdade.
  2. Um juiz — um modelo de avaliação (ou uma verificação determinística) que pontua cada saída quanto à fidelidade, relevância e segurança.
  3. Sondas de segurança — entradas adversariais que tentam quebrar a funcionalidade da forma como um usuário real ou um invasor faria.
  4. Um CI gate — a suíte roda a cada mudança; uma pontuação abaixo do piso mínimo, que só sobe, bloqueia o merge.

#Os princípios

  • Calculado, não afirmado. Uma pontuação vem de um comando que qualquer pessoa pode executar novamente — nunca de uma opinião.
  • Que suba, não que apenas passe. O piso só pode subir, para que a qualidade não se corroa silenciosamente com o tempo.
  • Reduza a revisão humana com evidências. Comece com um humano no circuito; remova pontos de aprovação somente quando os evals provarem que é seguro.
  • Nada de verde falso. Se o gate deveria estar vermelho, ele fica vermelho — publicamente. (O próprio placar deste site funciona da mesma forma.)
Aprofundamentos, cada um com um diagrama animado: O CI eval gate · Sondas de segurança · Golden sets e juízes · Aprovação humana.
Veja em ação
O eval ao vivo avalia uma IA em tempo real — aperte executar e veja ela falhar nas sondas.
Agendar uma chamada →
© 2026 Jason Teixeira · Sage Ideas LLC · Início da documentação