Automação de IA × QA / avaliação de LLM — engenheiroN 28.5384° W 81.3789°
Eu entrego funcionalidades de IA. Depois eu provo que funcionam.
Sou a pessoa que você chama quando está prestes a lançar uma funcionalidade de LLM que pode te constranger na frente de um cliente. Eu a construo, e também o mecanismo que a detecta no momento em que ela começa a desviar. veja por quê →
LLM apps e agentes, além de automação de fluxos de trabalho (RAG, LangGraph, n8n/Make), combinados com o arcabouço de regressão e avaliação que os mantém honestos em produção: Playwright, Pytest, k6, Promptfoo, DeepEval, LLM-as-judge. A maioria das pessoas constrói a IA ou a testa. Eu faço as duas coisas, e cada afirmação abaixo remete a um artefato.
0/13 gates de prova · vermelho→verde hoje
0 testes aprovados · 0% de cobertura de linhas
verificado · reproduzível com um único comando
um projeto por vez — agenda aberta para o Q4 de 2026
Sua operação de hoje, transformada em um sistema que você pode provar.
Role a página. O mesmo fluxo de cinco estágios, de manual-e-improvável a automatizado-e-protegido-por-avaliação. É a forma do que eu construo para você.
02
02 — o índice
Cinco sistemas, uma só tese.
01
Agentes · Aplicações LLMESTIMADO
sage-agents →
Monorepo de armazém de agentes: agentes de voz, SDR outbound, chat de suporte via RAG e orquestradores de fluxo de trabalho em Mastra + LangGraph. Vem com um roteador de LLM multi-provedor, rastreamento de custo por execução e tracing via Langfuse, além de um gate rígido de consentimento TCPA em toda chamada outbound.
página em branco → agente de cliente em staging em dias em vez de semanas (estimado a partir do tempo de scaffold do template)
MastraLangGraphVercel AI SDKSupabaseLangfuse
Privado · demonstração guiada sob solicitação
~/sage-agents
$ pnpm tsx infra/scripts/create-agent.ts \
inbound-voice acme-inbound-voice
scaffolded @sage/agent-acme-inbound-voice
✓ prompts · tools · evals/golden.json ready
fig. 02 · arquitetura · resultado ao vivo
02
Fluxo de trabalho autônomoVERIFICADO
sage-kernel →
OS de engenharia MCP proof-first: 140 ferramentas que um agente de IA opera através de política, aprovações assinadas, e um registro de prova encadeado por hash. Nada está "pronto" só porque um modelo disse que está. Um claim-firewall rejeita linguagem de sucesso não comprovada.
140 ferramentas MCP · 78 gates de release · verificado: suíte de gates + registro de prova encadeado por hash no repositório público
Base de conhecimento RAG onde toda resposta é extrativa e citada. Worker de ingestão durável, recuperação via pgvector, execuções de avaliação persistidas, e uma trilha de auditoria completa da fonte até a resposta.
100% de cobertura de citações · verificado em 2026-08-15: executado ao vivo, com uma pergunta real feita — a captura de tela abaixo é a resposta real
Fluxos de e-commerce críticos para release sob regressão, com a evidência que um release manager exigiria: traces, capturas de tela, quatro reporters, e um modelo de risco documentado. O CI envia artefatos a cada push.
37/37 specs · 15,3s · 0 instabilidades · verificado: pasta evidence/ no repositório público, execução datada de 10/07/2026
85 runners de qualidade sob uma única CLI, incluindo avaliações de alucinação, jailbreak, prompt-injection, toxicidade e vazamento de PII para funcionalidades de LLM. Cada pontuação é calculada a partir de um comando real e empacotada como evidência assinada com ed25519.
3.759 testes · 91% de cobertura · 13/13 · verificado em 2026-08-15: o gate de CVE ficou vermelho às 11:39, bloqueou o release, e ficou verde às 14:35. Ambas as execuções publicadas.
Como o trabalho realmente aconteceu, em fichas técnicas que você pode auditar.
Resultado primeiro; a especificação completa de oito seções — incluindo as partes que a maioria dos estudos de caso esconde — está um clique mais fundo. Todo número em destaque explica como foi medido.
spec BRIEF/01 · rev A
BRIEF/01
Triagem de feedback que roda sozinha
Fluxo de trabalho Make + Gemini
Feedback negativo agora aparece em segundos. Antes, esperava até a revisão de sexta-feira.
Google Forms→webhook do Make→Gemini 2.5 Flash · classificar + resumir→log no Sheets→negativo? → alerta por email
fig. 07 · fluxo do sistema, da esquerda para a direita
Problema
O feedback dos clientes chegava por um formulário e ficava sem leitura. Sinais negativos apareciam dias depois, quando o cliente já havia desistido.
Resultados medidos
Feedback negativo aparece em tempo real em vez de na revisão de final de semana — medido como latência de segundos entre o webhook e o alerta, contra uma passada manual semanal.
▸ver a especificação completa: mais 6 seções
Por que não um chatbot
Ninguém quer conversar com a própria fila de feedback. O valor é determinístico: classificar, resumir, rotear, alertar. Uma interface de chat adicionaria latência e removeria a possibilidade de auditoria.
Arquitetura
Cenário no Make, quatro passos de ponta a ponta (veja a fig. 1). Cada passo pode ser reexecutado isoladamente.
Recuperação / memória
Nenhuma necessária. Cada mensagem é classificada de forma independente. Evitado deliberadamente: a ausência de estado mantém o pipeline depurável.
Pontos de aprovação humana
A IA nunca responde diretamente a um cliente. Ela roteia para um humano com um resumo; o email de alerta é o handoff. Ela não resolve nada sozinha.
Salvaguardas de produção
Schema de saída estruturada na etapa de LLM, rótulo de fallback em caso de falha de parsing, e a mensagem bruta sempre registrada junto com a classificação.
O que eu reforçaria em seguida
Um golden set de mensagens rotuladas, rodado toda noite pelo Promptfoo, para capturar desvio de classificação quando a versão do modelo muda.
stack · Make · Gemini 2.5 Flash · Google Forms · Sheets · Gmail
spec BRIEF/02 · rev A
BRIEF/02
RAG que cita ou se cala
ai-research-dashboard
100% das respostas citam sua fonte. O pipeline não tem nenhum caminho sem citação.
fonte→chunker→embed → pgvector→recuperação por cosseno→resposta extrativa + citações→trilha de auditoria
fig. 08 · fluxo do sistema, da esquerda para a direita
Problema
Times de pesquisa precisam de respostas a partir do próprio corpus. Um sistema RAG que parafraseia com confiança e sem fontes é um passivo, não uma ferramenta.
Resultados medidos
100% das respostas respaldadas por citação — verificado por design: não existe caminho de geração sem citação. Qualidade, segurança, latência e custo rastreados por consulta no endpoint de analytics.
▸ver a especificação completa: mais 6 seções
Por que não um chatbot
Um wrapper de chat sobre o corpus era a construção óbvia. A necessidade real era um dashboard operacional: fontes, jobs de ingestão, execuções de avaliação e feedback, tudo inspecionável. O Q&A é apenas uma funcionalidade dentro dele.
Arquitetura
API em FastAPI + worker de ingestão durável alimentando a fig. 1; um gateway de provedor troca embeddings determinísticos locais pelo Gemini conforme o ambiente. Dashboard em React por cima.
Recuperação / memória
Consultas, respostas e citações persistidas. Excluir uma fonte propaga em cascata: chunks, embeddings, jobs, payloads, citações. Nenhuma memória órfã.
Pontos de aprovação humana
Um endpoint de feedback no nível da resposta alimenta um loop de revisão; as execuções de avaliação são disparadas e persistidas via API, para que um humano aprove antes que mudanças de provedor ou de limiar sejam lançadas.
Salvaguardas de produção
Respostas somente extrativas (citar ou se abster), trilha de auditoria completa sobre eventos de fonte/consulta/avaliação/feedback, provedores locais determinísticos para desenvolvimento reproduzível, fallback do Gemini para local quando faltam chaves.
O que eu reforçaria em seguida
Promover os limiares de avaliação a gates de deploy, para que uma regressão de recuperação bloqueie o release antes que ele chegue à retro.
3.759 testes. No dia do publish, o gate capturou um desvio real de CVE, me bloqueou, e ficou verde de novo até a tarde.
qa init · detectar stack→orquestrador DAG→85 runners · incluindo 10 avaliações de segurança de LLM→veredito computado→evidência assinada com ed25519
fig. 09 · fluxo do sistema, da esquerda para a direita
Problema
Dashboards de qualidade exibem números que não conseguem defender. Para funcionalidades de LLM é pior: times lançam mudanças de prompt sem nenhum sinal de regressão.
Resultados medidos
3.759 testes, 91,12% de cobertura de linhas, 13/13 gates. Em 15/08/2026 o gate de CVE ficou honestamente vermelho (15 de alta/crítica severidade nas dependências) e bloqueou seu próprio release — corrigido e PROVEN de novo na mesma tarde, ambas as execuções publicadas na íntegra. Um único comando regenera o scorecard.
▸ver a especificação completa: mais 6 seções
Por que não um chatbot
Um "assistente de QA de IA" que opina sobre qualidade é exatamente o modo de falha. O veredito precisa ser calculado por código a partir dos exit codes dos comandos. Aqui, um LLM nunca corrige a própria prova.
Arquitetura
Uma única CLI conduzindo a fig. 1: cada runner é um plugin (detect → plan → run → collectEvidence); um runner travado não consegue travar uma execução. Dois gates: pré-commit com menos de 15ms, e um gate de merge sobre o repositório inteiro.
Recuperação / memória
Um registro de evidência em vez de memória: o comando exato, o exit code e a métrica interpretada de cada execução são gravados em um registro de prova, reverificável offline.
Pontos de aprovação humana
O loop autônomo de correção é limitado. Ele corrige apenas o que o arcabouço consegue verificar, faz commit quando há melhora, reverte quando há regressão, e para honestamente em caso de impasse para revisão humana.
Salvaguardas de produção
Contrato anti-alucinação: nenhuma pontuação sem um artefato de respaldo. Pisos de cobertura crescentes, disciplina de honest-skip, evidência redigida e assinada com ed25519.
Cobertura de avaliação de LLM
Dez runners dedicados de segurança de IA: viés, consistência, alucinação, jailbreak, prompt-injection, recusa, toxicidade, vazamento de PII, custo, latência. Esse é o arcabouço que eu trago para as funcionalidades de LLM dos meus clientes.
Escopo fixo, entregáveis fixos, evidência incluída. Cada oferta é uma versão produtizada de algo apresentado nos briefings acima.
Contratando para uma posição fixa? Estas são as três capacidades que eu traria para o seu time desde o primeiro dia, cada uma respaldada por um sistema já entregue acima.
QA e arcabouço de avaliação para funcionalidades de LLM
Sua funcionalidade de LLM ganha uma suíte de regressão: golden traces, pontuação via LLM-as-judge para fidelidade e segurança, e um gate de CI que bloqueia o deploy quando a qualidade cai.
→ Suíte Promptfoo / DeepEval sobre os seus padrões reais de tráfego
→ Runners de alucinação, injection e toxicidade
→ Gate de CI + scorecard que o seu PM consegue ler
prova: nexural-qa-os · 85 runners, incluindo 10 avaliações de segurança de IA
Uma suíte Playwright/Pytest com escopo baseado em risco e a disciplina de evidência de um release manager: traces, relatórios, artefatos, integrados ao GitHub Actions desde o primeiro dia.
→ Modelo de risco → matriz de cobertura em vez de uma sopa de scripts
→ Quatro reporters, trace-on-retry, retenção de artefatos
→ Baseline de carga com k6 no caminho crítico
prova: playwright-sdet-regression-suite · 37/37 em CI
Construção de automação de fluxo de trabalho de IA
Uma automação funcional (entrada, triagem, roteamento, respostas apoiadas em RAG) construída em n8n/Make ou LangGraph, com pontos de aprovação humana onde eles fazem sentido e logs que você pode auditar.
→ n8n / Make / Zapier ou LangGraph em nível de código
→ Gates human-in-the-loop, saídas estruturadas
→ Runbook + handoff para que o seu time assuma a posse
prova: templates do sage-agents · pipeline de triagem de feedback
Uma melhoria visível, com qualidade de produção: entregue, medida, no seu repositório.
03 · Construção
~4–8 semanas· escopado e orçado
O sistema completo: suíte, gate, automação, runbook, com posse do seu time no handoff.
04 · Operação
contínuo· opcional
Medir, melhorar, publicar: o sistema se acumula em vez de decair silenciosamente.
spec OFFER/01 · preço fixo
OFFER/01
A Auditoria de Avaliação
$2.500
Uma semana, preço fixo.
Eu rodo sua funcionalidade de IA em produção através de uma bateria de avaliação real — correção, segurança, alucinação, prompt-injection — e te entrego um relatório pontuado, as transcrições que falharam, e uma lista priorizada de correções. Os $2.500 são abatidos integralmente no valor do projeto se você seguir em frente. O projeto em si é orçado com base no que a auditoria encontrar, então você continua pagando pelo seu problema, não por um pacote.
O único entregável padronizado e de preço fixo que eu vendo. Tudo o que vem depois dele — o projeto — permanece escopado e orçado com base no que a auditoria revelar.
✓Todo projeto é orçado por escrito antes de o trabalho começar: escopo fixo, nunca horas em aberto. A taxa da auditoria é abatida integralmente no valor do projeto se você seguir em frente. Se o escopo mostrar que não posso ajudar, eu digo isso claramente e não custa nada.
um projeto por vez — agenda aberta para o Q4 de 2026
como funciona um projeto típico de 4 semanas
SEMANA 1
Escopo e mapa de risco
Sua funcionalidade, seus modos de falha. Alinhamos o que "funcionar" significa e como isso será medido.
SEMANA 2–3
Construção
A automação, o agente, ou a suíte: no seu repositório, no seu CI, nas suas convenções.
SEMANA 3–4
Arcabouço e gate
Avaliações e regressão integradas ao CI. Um gate vermelho bloqueia o deploy antes que ele chegue à retro.
HANDOFF
Runbook e evidência
Documentação, scorecard, e uma demonstração guiada para que seu time assuma sem depender de mim.
perguntas frequentes
Já temos QA. Por que trazer você?
Seu time de QA quase certamente cobre a superfície determinística. A lacuna é a funcionalidade de LLM: sem golden set, sem judge, sem gate. Mudanças de prompt são lançadas no feeling. Eu adiciono a camada de avaliação ao seu pipeline existente; seu time assume a posse quando eu saio.
Você trabalha no nosso stack ou no seu?
No seu. Seu repositório, seu CI, suas convenções. Todo projeto termina com um runbook e uma demonstração guiada. O entregável é um sistema que seu time opera sem mim. Não existe dependência de mim.
Quanto custa um projeto?
Não existe uma tabela de preços fixa, porque o escopo varia demais para que uma fosse honesta. Todo projeto é orçado por escrito após uma breve chamada de escopo: escopo fixo, nunca horas em aberto. A chamada inicial de 30 minutos é gratuita e termina com um plano concreto e um número real, de qualquer forma. Comece pela auditoria e você já recebe embutido o orçamento do projeto maior.
Com que rapidez você pode começar?
Aceito um projeto por vez (veja o indicador de disponibilidade no topo da página). A semana 1 é de escopo, então o risco de agenda é baixo: você vai saber exatamente o que está recebendo antes de o projeto começar.
Qual é o prazo típico?
A auditoria dura uma semana. Sprints do tamanho de um piloto duram de 2 a 3 semanas; projetos completos, de 4 a 8, dependendo do escopo. Todo projeto entrega algo visível dentro das duas primeiras semanas. Sem longas fases silenciosas.
Como você lida com nossos dados e código?
Aberto a NDA. O acesso é escopado ao projeto, as credenciais permanecem nos seus sistemas, o código permanece nos seus repositórios, e nada é retido após o handoff. O one-pager sobre tratamento de dados está disponível antes de começarmos.
E se as avaliações mostrarem que nossa funcionalidade de IA já está boa?
Então você lança com evidência em vez de esperança. Essa já é a vitória. A suíte permanece no CI capturando a regressão que teria acontecido daqui a seis semanas.
Posições fixas?
Aberto para a oportunidade certa. O botão "Contrate-me" no topo reorganiza esta página para recrutadores, e o currículo em PDF está a um clique de distância.
05
05 — sobre
JTJason Teixeira
Por treze anos meu trabalho foi garantir que o software realmente funcionasse. O tipo de QA em que um bug não detectado custa dinheiro de verdade. Depois as funcionalidades de IA começaram a ser lançadas na base da demo e da esperança, e eu vi bons produtos quebrarem de formas que o cliente descobria primeiro. Então agora eu construo as duas metades: a IA, e a prova de que ela funciona.
— Jason Teixeira · fundador, Sage Ideas
Eu dirijo a Sage Ideas, um estúdio nativo de IA, e passei anos construindo a mesma coisa em cada camada: sistemas que se recusam a dizer "pronto" sem evidência.
Essa tese se manifesta como um OS de engenharia com um registro de prova encadeado por hash, uma plataforma de QA onde cada pontuação é calculada a partir de um comando real, e pipelines de agentes com avaliações golden-trace integradas ao CI. O padrão é sempre o mesmo: lançar a funcionalidade e, em seguida, lançar o maquinário que a detecta quando ela regride.
Se o seu time está lançando funcionalidades de LLM no feeling (sem suíte de avaliação, sem gate de regressão, sem saber se a mudança de prompt da semana passada piorou as coisas), essa é exatamente a lacuna que eu fecho.
Eu construo
LangGraph · agentes Mastra
RAG — pgvector · citações
fluxos n8n · Make · Zapier
Next.js · FastAPI · Supabase
agentes de voz — Retell · Vapi
JTum só engenheiro
Eu provo
Playwright · Pytest · k6
Promptfoo · DeepEval
LLM-as-judge — fidelidade
avaliações de jailbreak · injection · PII
gates de CI · evidência assinada
capacidade
construtor de IA típico
engenheiro de QA típico
eu
Lança funcionalidades de LLM (RAG, agentes, automação)
✓
—
✓
Constrói suítes de avaliação e gates LLM-as-judge
raro
raro
✓ entregue
Disciplina de regressão em CI (Playwright/Pytest)
—
✓
✓ 13 anos
Bateria de segurança de IA (injection · PII · toxicidade)
—
—
✓ 10 runners
Evidência que você pode auditar (assinada, reproduzível)
—
raro
✓ por design
Certificado para isso (ISTQB CT-AI + TAE)
—
raro
✓ ambas
06
06 — histórico profissional
Rigor de Fortune 50, velocidade de fundador.
Treze anos entre varejo corporativo e fintech, além de um estúdio nativo de IA. Cada função na mesma disciplina: automação que prova que o software funciona. Currículo completo (PDF) ↓
Sage Ideas · Nexural
Fundador, Engenheiro de Automação de IA e QA2024 — atual · Orlando, FL / remoto
Construiu tudo o que está no índice acima: o armazém de agentes, o OS de engenharia proof-first, e uma plataforma de QA com 85 runners, incluindo dez avaliações dedicadas de segurança de LLM.
Nexural Research: 58 endpoints FastAPI · 604 testes · 93% de cobertura, validação de respostas de IA que cruza as afirmações do modelo com métricas determinísticas da fonte.
Infraestrutura de testes baseada em Kubernetes executando mais de 500 testes contra fluxos de negociação ao vivo (volume diário acima de US$ 100 mil); taxa de instabilidade reduzida de 10% para <1% com retry inteligente.
Execução de testes de 45 min para 8 min (−82%) via containerização com Docker e execuções paralelas entre microsserviços.
execução de testes45m → 8m
The Home Depot
Testador de Software → Engenheiro de Automação → Engenheiro de Cloud2012 — 2021 · Fortune 50
Framework Selenium + Python para sistemas atendendo mais de 2.300 lojas: regressão de 4h para 75min (−70%), mais de 300 casos automatizados com 99,5% de estabilidade.
Liderou a migração corporativa para AWS (Terraform, Kubernetes): −35% no custo de infraestrutura, deploys de 4h para 15min via pipelines Jenkins/GitLab.
regressão4h → 75m
deploys4h → 15m
credenciais
ISTQB CT-AI — testes de IAISTQB Test Automation EngineerISTQB CTFLAWS Cloud PractitionerAWS ML FoundationsTripleTen AI Automation
Bacharelado em Ciência da Computação, Full Sail · Bacharelado em Finanças, Kean · Inglês e Português nativos · Espanhol profissional
07 — em números
13+
anos em qualidade e automação
140
repositórios públicos no GitHub
85
runners de qualidade construídos
78
gates de release, todos verdes
08
08 — notas de campo
Anotações de trabalho direto das trincheiras proof-first.
✓Todo projeto é orçado por escrito antes de o trabalho começar: escopo fixo, nunca horas em aberto. A taxa da auditoria é abatida integralmente no valor do projeto se você seguir em frente. Se o escopo mostrar que não posso ajudar, eu digo isso claramente e não custa nada.
um projeto por vez — agenda aberta para o Q4 de 2026
mini-avaliação gratuita · uma amostra de trabalho que fica com você
Me envie sua funcionalidade de IA. Vou rodar uma mini-avaliação gratuita nela e te enviar os resultados: aprovado/reprovado, exemplos de falha e o que eu bloquearia antes do seu próximo lançamento. Nenhuma chamada é necessária.
use o formulário abaixo; coloque a URL da funcionalidade na mensagem e escolha qualquer estágio
1 — chamada inicial
30 minutos, grátis. Traga a funcionalidade que te tira o sono.
2 — mapa de risco
Semana 1: alinhamos o que "funcionar" significa e como isso será medido.
3 — orçamento fechado
Preço vinculado a entregas, em vez de horas em aberto. De qualquer forma, o plano é seu.