EN·ES·PT
Contrate · Engenharia de qualidade de IA

Contrate um engenheiro de QA de IA antes que a sua LLM vá para produção sem testes.

Um recurso de IA que entra em produção sem testes não quebra — ele falha em silêncio. Ele alucina uma política, cita uma fonte que não existe, vaza um prompt ou, com total confiança, dá a um cliente o número errado. Ninguém recebe um stack trace. Você descobre por um print nas redes sociais. Eu sou o engenheiro que você traz antes que isso aconteça: construo as suítes de avaliação, os gates de julgamento e a disciplina de regressão em CI que pegam uma resposta ruim enquanto ela ainda está no seu pipeline — e não na frente dos seus clientes.

ISTQB CT-AI ISTQB Test Automation Engineer Demo de avaliação ao vivo: avalie a sua própria IA ↗
Assista à apresentação completa
O risco · por que este papel existe

Quem constrói o recurso é a pessoa errada para provar que ele funciona.

Quem escreveu o prompt já acredita que ele funciona — e esse é exatamente o viés que o QA existe para quebrar. Um recurso de LLM tem modos de falha que o software comum não tem: é não determinístico, degrada em silêncio quando um modelo ou prompt muda mais acima na cadeia, e "parece certo" não é o mesmo que "está certo". Testar isso exige uma disciplina que fica entre construir IA e o QA tradicional. Essa é a lacuna que eu preencho.

O que vai para produção sem testes
  • Fatos, políticas e preços alucinados, afirmados com total confiança
  • Citações a fontes que não existem
  • Caminhos de prompt-injection e jailbreak que ninguém sondou
  • Regressões silenciosas quando o modelo ou o prompt muda
O que isso custa a você
  • Uma resposta errada a um cliente real, em público
  • Nenhum jeito de saber se a correção da semana passada quebrou a resposta desta semana
  • "Funcionou na demo" — e em nenhum outro lugar
  • Uma confiança que você não tem uma segunda chance de conquistar
Como é quando está bom
  • Um golden set de respostas esperadas avaliadas
  • Gates de julgamento automatizados para segurança e qualidade
  • Um gate de CI que bloqueia o lançamento quando uma verificação falha
  • Toda afirmação rastreável a uma fonte, por construção
A lacuna de capacidade · quem faz o quê

Um construtor de IA, um engenheiro de QA e eu somos contratações diferentes.

A maioria das equipes já tem alguém que consegue construir um recurso de LLM e, talvez, alguém que consegue escrever testes de UI. Nenhum dos dois, sozinho, fecha o ciclo da qualidade de IA. Aqui está a divisão honesta.

Comparação de capacidades
Capacidade Construtor de IA QA generalista Eu (QA de IA)
Coloca recursos de LLM em produção Sim Não Sim
Constrói suítes de avaliação e gates de julgamento Raramente Parcial Sim
Disciplina de regressão em CI Um pouco Sim Sim
Sondagem de segurança / injeção Raramente Raramente Sim
Certificado em testes de IA (ISTQB CT-AI) Não Varia Sim

Sim = força central · Parcial / Varia = depende da pessoa · Não / Raramente = não é o papel. Avaliado com honestidade — existe um construtor de IA que também constrói gates de avaliação, mas não é o padrão.

O mecanismo · o gate de avaliação

Toda resposta de IA passa por um pente-fino antes de um cliente vê-la.

Esta é a forma do sistema que eu construo. A saída da sua IA não vai para produção na base da fé — ela é avaliada em relação a verificações de segurança e qualidade, e um gate de CI toma uma decisão binária: libera, ou bloqueia o lançamento e diz exatamente qual verificação falhou.

O fluxo do gate de avaliação de IA A saída da IA flui para verificações de segurança e qualidade e, em seguida, para um gate de CI que libera o lançamento ou o bloqueia. Saída da IA a resposta bruta SEGURANÇA + QUALIDADE • cobertura de citações • embasamento factual • injeção / jailbreak • formato e schema • match com golden set Gate de CI passou? passou LIBERA ✓ lançamento segue falhou BLOQUEADO ✗ lançamento retido

A mesma disciplina de gate roda neste próprio site. Quer ver uma verificação pontuar uma resposta real? Cole a saída da sua IA na demo ao vivo e veja-a ser avaliada.

▸ avalie a sua própria IA, ao vivo avaliação real · roda no seu navegador · sem cadastro
Guia do comprador · como distinguir uma contratação de verdade de uma loja que revende Zapier

Nem todo mundo que vende "QA de IA" está testando IA.

Muitas ofertas de "QA de IA" são um fluxo de Zapier com um chatbot acoplado. Veja como perceber a diferença antes de assinar qualquer coisa.

⚑ Sinal de alerta

Mostra um chatbot respondendo perguntas e chama isso de "testado".

✓ Bom sinal

Mostra a você uma avaliação que falha e a verificação exata que a pegou.

⚑ Sinal de alerta

Cita um número de acurácia sem nenhum golden set por trás.

✓ Bom sinal

Entrega a você um golden set versionado que você é dono e pode reexecutar.

⚑ Sinal de alerta

"Funciona" — mas nada roda no CI e nada bloqueia um lançamento ruim.

✓ Bom sinal

Conecta um gate ao seu pipeline que reprova o build em regressões.

⚑ Sinal de alerta

Não sabe explicar não determinismo, drift ou risco de prompt-injection.

✓ Bom sinal

Sonda caminhos de segurança e injeção e consegue provar os resultados.

A prova · afirmações que posso sustentar

A tese inteira deste site: provas em vez de promessas.

Todo número aqui está ligado à sua evidência. Se eu não consigo mostrar, eu não digo.

Meu próprio QA OS bloqueou o próprio lançamento

Um sistema de QA que construí pegou 15 CVEs alto/crítico, se recusou a ir para produção e foi corrigido no mesmo dia, chegando a 3.759 testes passando em 13 de 13 gates. O antes e o depois estão ambos capturados.

Disciplina de regressão, medida

Uma suíte de regressão de SDET rodando 37 de 37 specs, 0 flakes, em 15,3s. O código-fonte completo é público.

Geração embasada, por construção

Um dashboard de pesquisa RAG com 100% de cobertura de citações por construção — não existe caminho de código capaz de gerar uma afirmação sem citação.

Histórico em sistemas reais
  • HighStrike (fintech): taxa de flakes 10% → abaixo de 1%, mais de 500 testes em workflows de trading ao vivo
  • The Home Depot (Fortune 50): framework Selenium para mais de 2.300 lojas, regressão 4h → 75min
  • Este site roda o seu próprio QA — mais de 100 verificações, limpo no axe
números públicos apontam para um comprovante; os números de HighStrike e Home Depot são de cargos anteriores em tempo integral, autorrelatados · nada arredondado para cima para uma apresentação
Relacionados · mais sobre testar IA

Preocupado com um recurso de IA que você está prestes a lançar?

Agende uma conversa e vamos definir o escopo do gate de avaliação que o seu recurso precisa — ou avalie uma das respostas da sua IA ao vivo, agora mesmo, e veja a disciplina você mesmo.

Agende uma conversa → Avalie a sua própria IA ao vivo

Prefere ler primeiro? Veja avaliação e QA de LLM ou o guia do gate de avaliação.

perguntas frequentes

Perguntas, respondidas.

Preciso de uma contratação em tempo integral ou isso pode ser um contrato?
A maioria dos trabalhos começa como um contrato com escopo definido — uma auditoria ou uma construção — e não como uma vaga fixa. Você obtém a cobertura sem precisar contratar, e tudo fica no seu repositório para que a sua equipe possa executar depois da entrega.
O que um engenheiro de QA de IA realmente entrega?
Os testes e avaliações que provam que o seu recurso de IA funciona: golden sets, pontuação com LLM-as-judge e gates de CI que bloqueiam um lançamento ruim, além de um runbook que a sua equipe pode operar.
Como isso é diferente de um QA/SDET comum?
O QA padrão verifica software determinístico. Os recursos de IA são não determinísticos, então precisam de avaliação — a resposta é fiel, citada, segura? — além dos testes tradicionais. Eu cubro as duas frentes.
Com que rapidez você consegue começar e ver resultados?
Uma auditoria de uma semana lhe dá um plano priorizado e as lacunas de maior alavancagem; uma primeira avaliação ou gate de CI funcionando normalmente fica pronta em cerca de duas semanas.
Isso é um contrato ou uma contratação em tempo integral?
Um contrato, por padrão — com escopo definido por um resultado, não por um cargo. Se mais tarde você quiser cobertura contínua, podemos migrar para um retainer, mas nada obriga uma decisão de headcount.
Com que rapidez você se ambienta à nossa stack e ao nosso código?
A ambientação começa no primeiro dia: eu leio o seu repositório, os prompts e os testes existentes antes de escrever qualquer coisa. Adaptar-me ao modo como a sua stack já funciona importa mais do que impor uma nova.
Com quais ferramentas e frameworks você trabalha?
Pytest e Playwright para a camada de testes, LangGraph, CrewAI e n8n para orquestração de agentes e workflows, e harnesses de LLM-as-judge para a camada de avaliação. Eu trabalho com o seu modelo em vez de substituí-lo pelo meu.
Você trabalha diretamente no nosso repositório e CI?
Sim — tudo chega como pull requests no seu repositório e gates que rodam no seu CI, não um sistema paralelo que você não consegue ver. Quando o trabalho termina, a sua equipe é dona e executa tudo.
Como você colabora remotamente e entre fusos horários?
Totalmente remoto e async-first: o trabalho avança por pull requests, atualizações escritas e um runbook compartilhado, de modo que nada depende de uma chamada ao vivo. Mantenho horas de sobreposição para revisão e decisões que destravam.
Como o trabalho tem escopo e preço definidos?
O escopo é fixado em uma entrega, como uma auditoria, uma suíte de avaliação ou um gate de CI, e o preço é por trabalho e não por hora. Você aprova o escopo antes de o trabalho começar, então não há um medidor em aberto.