EN·ES·PT
Estudos de caso · prova que você pode abrir

Quatro sistemas. Quatro resultados medidos. Todos com link para o comprovante.

Sem logos que eu não possa comprovar e sem números que eu não possa mostrar. Cada um destes é um sistema que construí ou resgatei, com a métrica que importou, e um link para o repositório público, a execução literal, ou a captura de tela ao vivo que comprova isso.

Engenharia de testes Fortune-50 ISTQB Engenheiro de Automação de Testes Código aberto: llm-eval-gate · playwright-sdet Este site executa seu próprio QA — 100+ verificações, limpo no axe
Qualidade e avaliação de IA · nexural-qa-os

A plataforma de QA que se recusou a mostrar um falso verde.

vermelho → verde O gate de CVE ficou vermelho às 11:39, bloqueou o lançamento, e voltou a um comprovado 13/13 às 14:35. Ambas as execuções publicadas na íntegra.
O problema

Uma plataforma de qualidade só é confiável se puder falhar. Em uma execução real, o gate de auditoria de dependências encontrou 15 CVEs de alta/crítica severidade. O veredito honesto foi não apto para lançamento, não um selo verde.

O que eu fiz
  • Deixei o gate ficar vermelho e publiquei a execução na íntegra: sem substituição silenciosa
  • Corrigi o desvio na origem: 9 pisos de segurança fixados, eliminando a cadeia transitiva não corrigível
  • Executei novamente toda a bateria: 85 runners incl. 10 avaliações de segurança de LLM
O resultado

3,759 testes · 91% de cobertura · 13/13 gates. CVEs de alta/crítica severidade: 15 → 0. Todo o arco de detectado→bloqueado→corrigido→comprovado está no site, ambas as capturas incluídas.

▸ a execução em vermelho (na íntegra) ▸ a nova execução em verde verificado 2026-08-15 · ambas as execuções publicadas
Automação de testes · playwright-sdet-regression-suite

Uma suíte de regressão em que um gerente de lançamento pode confiar.

37/37 specs verdes no CI · 15.3s · 0 flakes — com traces, capturas de tela, e um modelo de risco documentado.
O problema

A maioria das suítes é uma sopa de scripts: a cobertura segue quem escreveu testes por último, o vermelho é ignorado porque é flaky, e cada falha inicia uma caça ao tesouro por capturas de tela.

O que eu fiz
  • Modelo de risco → matriz de cobertura, para que a cobertura acompanhe o risco do lançamento
  • Page Object Model, fixtures, trace no retry, quatro reporters
  • Conectado ao CI com retenção de artefatos, um selo verde que significa algo
O resultado

37/37 specs, zero flakes, 15.3s. A pasta de evidências — traces e capturas de tela — é publicada no repositório público. Clone e reproduza a execução.

▸ repositório público ▸ a execução verificado · execução datada de 2026-07-10, evidência no repositório
Engenharia de IA · painel de pesquisa RAG

Um assistente de IA que não consegue responder sem uma citação.

100% das respostas citam sua fonte, incorporado ao design em vez de solicitado por prompt. Não existe caminho de geração sem citação.
O problema

A maioria das demos de RAG alucina com confiança. "Fundamentado" é afirmado no prompt e silenciosamente violado em produção na primeira vez que a recuperação retorna escassa.

O que eu fiz
  • Construí a recuperação para que toda resposta esteja vinculada a trechos classificados e selecionados
  • Removi completamente o caminho de geração sem citação: abstém quando não há evidência
  • Rastreei qualidade, segurança, latência e custo por consulta em um endpoint de analytics
O resultado

100% de cobertura de citações, por construção. Verificado ao vivo. Executei, fiz uma pergunta real, e capturei a resposta citada real (captura de tela na página inicial).

▸ captura de tela ao vivo + arquitetura verificado 2026-08-15 · executado ao vivo, consulta real capturada
Resgate de CI · HighStrike (suíte de produção)

Fazendo o vermelho voltar a significar algo em uma suíte ao vivo.

10% → <1% taxa de flake em uma suíte de produção ao vivo — reduzida com lógica de retry e correções de isolamento de testes, sem necessidade de reconstrução.
O problema

Uma suíte flaky é pior do que nenhuma: quando o vermelho é ruído, a equipe aprende a ignorá-lo, e a regressão real passa despercebida junto com os falsos alarmes.

O que eu fiz
  • Diagnostiquei as fontes de flake: estado compartilhado, timing, ordenação
  • Instalei um protocolo de flake: faixa de quarentena, política de retry, correções de isolamento
  • Mantive a suíte existente e tratei a reconstrução como último recurso
O resultado

Taxa de flake 10% → abaixo de 1%. O vermelho voltou a ser um sinal real, sustentado pela mesma disciplina de nível Fortune-50 por trás da infraestrutura de 500+ testes no início da minha carreira.

▸ o serviço em que isso se tornou ▸ histórico completo de um engajamento real com cliente · método produtizado

Quer que seu sistema seja o próximo nesta página?

Comece com uma mini-avaliação gratuita da sua funcionalidade de IA ao vivo, ou agende uma chamada e vamos definir o caminho mais rápido para um resultado medido.

Agendar uma chamada → ou obtenha o relatório de avaliação de amostra →