A superfície de falha
O que os testes unitários não pegam — e o que captura.
Cada linha é uma falha que um teste unitário de turno único é estruturalmente incapaz de observar, associada à sonda que a captura.
Método, não dependência de fornecedor. As mesmas três famílias — golden probes multi-turno, uma bateria de red-team e execuções de repetição/robustez — se aplicam ao LangGraph, a um loop personalizado ou a um framework de agente pronto.
perguntas frequentes
Perguntas, respondidas.
Por que agentes são mais difíceis de testar do que um único prompt?
Eles tomam ações em várias etapas com ferramentas e memória, então as falhas se acumulam ao longo das etapas e a mesma entrada pode seguir caminhos diferentes. Você testa toda a trajetória, não apenas a resposta final.
O que você realmente verifica em um agente?
Correção das chamadas de ferramenta, comportamento de loop e terminação, aderência às guardrails, custo e latência, e recuperação de uma etapa ruim — além do resultado de ponta a ponta.
Isso funciona com LangGraph ou um loop personalizado?
Sim. As mesmas famílias de verificações se aplicam, seja LangGraph, um loop de agente personalizado ou outro framework; eu conecto o harness à sua implementação.
Você pode bloquear deploys com base em avaliações de agentes?
Sim. A avaliação do agente roda no CI e bloqueia um release que regride nas trajetórias que importam.
Quais frameworks de agente você suporta — LangGraph, CrewAI ou um loop personalizado?
Todos eles. As verificações têm como alvo a trajetória do agente, não o framework, então LangGraph, CrewAI e loops feitos à mão são conectados da mesma forma. Eu adapto o harness a qualquer runtime que você já use.
Como você bloqueia um deploy com base no comportamento do agente sem bloquear todo release?
A avaliação roda no CI contra um conjunto fixo de golden trajectories e só bloqueia quando o comportamento regride nelas. O não-determinismo é tratado com faixas de tolerância e execuções repetidas, então um release saudável é publicado e uma regressão real o interrompe.
Como é o cronograma típico de um engajamento?
Começa com uma etapa curta de escopo para mapear as trajetórias críticas do seu agente, depois uma fase de construção das golden probes e da bateria de red-team, e então a entrega com o harness conectado ao CI. O trabalho é concentrado no início; o harness continua rodando depois que eu saio.
O que eu realmente recebo ao final do engajamento?
Um harness de testes em execução no seu repositório — golden probes, uma bateria de red-team e o gating no CI — mais um relatório escrito das falhas encontradas e de como cada uma passa a ser capturada. Tudo é seu para rodar e estender sem mim.
Como você testa agentes que chamam ferramentas e APIs externas?
As chamadas de ferramenta são exercitadas contra fakes controlados e fixtures gravados para que os testes permaneçam determinísticos, e depois verificadas por amostragem contra a integração ao vivo. Isso captura chamadas malformadas, argumentos ruins e erros de ferramenta mal tratados antes que cheguem à produção.
Como o escopo e o preço de um engajamento de teste de agentes são definidos?
O escopo acompanha a superfície do seu agente — o número de trajetórias, ferramentas e guardrails que precisam de cobertura — e o preço é uma cotação fixa por escopo acordado. Você recebe a estimativa antes de qualquer trabalho começar, sem contador de horas em aberto.