EN·ES·PT
notas de campo — engenharia proof-first

Notas de trabalho, escritas entre commits.

Curtas, específicas e baseadas em sistemas que eu realmente lancei. Textos mais longos vivem em sageafterdark.com.

Dezoito agentes auditaram um currículo em produção. Uma lição estava ensinando um erro falso. Apontei uma frota de auditoria para 34 lições de programação publicadas: seis auditores executando cada afirmação de código, seis reescritores, seis verificadores independentes. 73 defeitos, 17 críticos ou altos — cada um ancorado em uma citação literal. Treze minutos de tempo real. 5 min de leitura → Cinco páginas, cinco agentes, um arquivo de design — zero conflitos de merge Uma frota de agentes em paralelo implementou cinco páginas de marketing em produção 1:1 a partir de arquivos de design em cerca de cinco minutos de tempo real. A parte interessante não é a velocidade — são as três regras que tornaram o resultado lançável. 4 min de leitura → O dia em que meu próprio gate de qualidade me bloqueou Às 11:39 meu ciclo de prova recusou o veredito PROVEN — 15 CVEs críticos/altos haviam se infiltrado nas dependências de produção. Às 14:35 estava verde. Ambas as execuções são publicadas na íntegra. 4 min de leitura → Testes de regressão de LLM com Promptfoo em CI: o gate mínimo viável 30 golden traces, um judge, um exit code de falha. A menor configuração capaz de impedir que uma mudança de prompt ruim chegue à produção — executável ainda hoje à tarde. 6 min de leitura → Nada de verde falso: o que um registro de prova me ensinou sobre agentes de IA Agentes relatam de bom grado um sucesso que nunca conquistaram. A solução não é um prompt melhor — é um gate de evidência que o agente fisicamente não consegue burlar com palavras. 6 min de leitura → Sua funcionalidade de LLM precisa mais de uma suíte de regressão do que de um prompt melhor Ajustes de prompt parecem progresso porque ninguém está medindo. Golden traces + LLM-as-judge em CI transformam o "parece melhor" em um diff que você pode usar como critério de gate. 5 min de leitura → Automação que nunca fala diretamente com o seu cliente O fluxo de automação de IA com melhor conversão que já entreguei não envia nenhuma mensagem escrita por IA. Onde posicionar o ponto de aprovação humana, e por que isso supera a autonomia total. 4 min de leitura →

artefato gratuito: o checklist de avaliação pré-lançamento para funcionalidades de LLM →