EN·ES·PT
Contratación · Ingeniería de calidad de IA

Contrate a un ingeniero de QA de IA antes de que su LLM salga sin probar.

Una función de IA que se lanza sin pruebas no se cae — falla en silencio. Alucina una política, cita una fuente que no existe, filtra un prompt o, con total confianza, le da a un cliente el número equivocado. Nadie recibe un stack trace. Se entera por una captura de pantalla en redes sociales. Yo soy el ingeniero que incorpora antes de que eso ocurra: construyo las suites de evaluación, los gates de juez y la disciplina de regresión en CI que detectan una mala respuesta mientras todavía está en su pipeline — no frente a sus clientes.

ISTQB CT-AI ISTQB Test Automation Engineer Demo de evaluación en vivo: califique su propia IA ↗
Vea la presentación completa
El riesgo · por qué existe este rol

Quienes construyen la función son las personas equivocadas para demostrar que funciona.

Quien escribió el prompt ya cree que funciona — ese es exactamente el sesgo que QA existe para romper. Una función de LLM tiene modos de fallo que el software ordinario no tiene: es no determinista, se degrada en silencio cuando un modelo o un prompt cambia aguas arriba, y "parece correcto" no es lo mismo que "es correcto". Probarla requiere una disciplina que se sitúa entre la construcción de IA y el QA tradicional. Esa es la brecha que yo cubro.

Lo que se lanza sin probar
  • Hechos, políticas y precios alucinados y afirmados con total confianza
  • Citas a fuentes que no existen
  • Rutas de inyección de prompts y jailbreak que nadie sondeó
  • Regresiones silenciosas cuando cambia el modelo o el prompt
Lo que le cuesta
  • Una respuesta equivocada a un cliente real, en público
  • Ninguna forma de saber si el arreglo de la semana pasada rompió la respuesta de esta semana
  • "Funcionó en la demo" — y en ningún otro sitio
  • Confianza que no tendrá una segunda oportunidad de ganarse
Cómo se ve lo correcto
  • Un conjunto de referencia (golden set) de respuestas esperadas y calificadas
  • Gates de juez automatizados para seguridad y calidad
  • Un gate de CI que bloquea la versión cuando una comprobación falla
  • Cada afirmación rastreable hasta una fuente, por construcción
La brecha de capacidades · quién hace qué

Un constructor de IA, un ingeniero de QA y yo no somos la misma contratación.

La mayoría de los equipos ya tienen a alguien que puede construir una función de LLM, y quizá a alguien que puede escribir pruebas de UI. Ninguno de los dos, por sí solo, cierra el ciclo de la calidad de la IA. Esta es la división honesta.

Comparación de capacidades
Capacidad Constructor de IA QA generalista Yo (QA de IA)
Lanza funciones de LLM en producción Sí No Sí
Construye suites de evaluación y gates de juez Rara vez Parcial Sí
Disciplina de regresión en CI Algo Sí Sí
Sondeo de seguridad / inyección Rara vez Rara vez Sí
Certificado en pruebas de IA (ISTQB CT-AI) No Varía Sí

Sí = fortaleza principal · Parcial / Varía = depende de la persona · No / Rara vez = no es el rol. Valorado con honestidad — hay constructores de IA que también crean gates de evaluación, pero no es lo habitual.

El mecanismo · el gate de evaluación

Cada respuesta de IA supera una prueba de fuego antes de que un cliente la vea.

Esta es la forma del sistema que construyo. La salida de su IA no se lanza a ciegas — se puntúa contra comprobaciones de seguridad y calidad, y un gate de CI toma una decisión binaria: lanzarla, o bloquear la versión y decirle exactamente qué comprobación falló.

El flujo del gate de evaluación de IA La salida de IA fluye hacia comprobaciones de seguridad y calidad, luego hacia un gate de CI que o bien lanza la versión o la bloquea. Salida de IA la respuesta cruda SEGURIDAD + CALIDAD • cobertura de citas • fundamento factual • inyección / jailbreak • formato y esquema • coincidencia con golden set Gate de CI ¿pasa? pasa LANZAR ✓ la versión avanza falla BLOQUEADA ✗ versión retenida

La misma disciplina de gate hace funcionar este propio sitio. ¿Quiere ver cómo una comprobación puntúa una respuesta real? Pegue la salida de su IA en la demo en vivo y vea cómo se califica.

▸ califique su propia IA, en vivo evaluación real · se ejecuta en su navegador · sin registro
Guía del comprador · cómo distinguir una contratación real de una tienda que revende Zapier

No todos los que venden "QA de IA" están probando IA.

Muchas ofertas de "QA de IA" son un flujo de Zapier con un chatbot pegado encima. Así se nota la diferencia antes de firmar nada.

⚑ Señal de alerta

Muestra un chatbot respondiendo preguntas y llama a eso "probado".

✓ Buena señal

Le muestra una evaluación que falla y la comprobación exacta que la detectó.

⚑ Señal de alerta

Cita una cifra de precisión sin un golden set que la respalde.

✓ Buena señal

Le entrega un golden set versionado que usted posee y puede volver a ejecutar.

⚑ Señal de alerta

"Funciona" — pero nada se ejecuta en CI y nada bloquea una mala versión.

✓ Buena señal

Conecta un gate en su pipeline que hace fallar el build ante regresiones.

⚑ Señal de alerta

No sabe explicar el no determinismo, la deriva ni el riesgo de inyección de prompts.

✓ Buena señal

Sondea rutas de seguridad e inyección, y puede demostrar los resultados.

La prueba · afirmaciones que puedo respaldar

Toda la tesis de este sitio: pruebas por encima de promesas.

Cada cifra aquí está enlazada a su evidencia. Si no puedo mostrarlo, no lo digo.

Mi propio QA OS bloqueó su propia versión

Un sistema de QA que construí detectó 15 CVE altos/críticos, se negó a lanzarse a sí mismo y fue parcheado el mismo día hasta 3.759 pruebas pasando en 13 de 13 gates. El antes y el después están ambos capturados.

Disciplina de regresión, medida

Una suite de regresión SDET ejecutando 37 de 37 specs, 0 flakes, en 15,3 s. El código fuente completo es público.

Generación fundamentada, por construcción

Un dashboard de investigación RAG con 100 % de cobertura de citas por construcción — no hay ninguna ruta de código que pueda generar una afirmación sin cita.

Historial en sistemas reales
  • HighStrike (fintech): tasa de flakes 10 % → menos del 1 %, más de 500 pruebas sobre flujos de trading en vivo
  • The Home Depot (Fortune 50): framework Selenium para más de 2.300 tiendas, regresión 4 h → 75 min
  • Este sitio ejecuta su propio QA — más de 100 comprobaciones, limpio en axe
las cifras públicas enlazan a un recibo; los números de HighStrike y Home Depot son de roles anteriores a tiempo completo, autoinformados · nada redondeado al alza para una presentación
Relacionado · más sobre probar la IA

¿Le preocupa una función de IA que está a punto de lanzar?

Reserve una llamada y definiremos el gate de evaluación que su función necesita — o califique una de las respuestas de su IA en vivo, ahora mismo, y vea la disciplina por usted mismo.

Reservar una llamada → Califique su propia IA en vivo

¿Prefiere leer primero? Consulte Evaluación y QA de LLM o la guía del gate de evaluación.

preguntas frecuentes

Preguntas, respondidas.

¿Necesito una contratación a tiempo completo o puede ser por contrato?
La mayoría de los proyectos comienzan como un contrato acotado — una auditoría o una construcción — no como una plaza de plantilla. Obtiene la cobertura sin contratar, y todo queda en su repositorio para que su equipo pueda ejecutarlo tras la entrega.
¿Qué entrega realmente un ingeniero de QA de IA?
Las pruebas y evaluaciones que demuestran que su función de IA funciona: conjuntos de referencia (golden sets), puntuación con LLM-as-judge y gates de CI que bloquean una versión defectuosa, además de un runbook que su equipo puede operar.
¿En qué se diferencia esto de un QA/SDET normal?
El QA estándar comprueba software determinista. Las funciones de IA son no deterministas, así que necesitan evaluación — ¿es la respuesta fiel, citada, segura? — encima de las pruebas tradicionales. Yo hago ambas mitades.
¿Con qué rapidez puede empezar y ver resultados?
Una auditoría de una semana le da un plan priorizado y las brechas de mayor impacto; una primera evaluación o gate de CI funcional normalmente queda lista en unas dos semanas.
¿Es un proyecto por contrato o una contratación a tiempo completo?
Un contrato, por defecto — acotado a un resultado, no a un puesto. Si más adelante desea cobertura continua podemos pasar a un retainer, pero nada obliga a una decisión de plantilla.
¿Con qué rapidez puede familiarizarse con nuestro stack y base de código?
La familiarización empieza el primer día: leo su repositorio, sus prompts y sus pruebas existentes antes de escribir nada. Encajar en la forma en que su stack ya funciona importa más que imponer uno nuevo.
¿Con qué herramientas y frameworks trabaja?
Pytest y Playwright para la capa de pruebas, LangGraph, CrewAI y n8n para la orquestación de agentes y flujos de trabajo, y arneses de LLM-as-judge para la capa de evaluación. Trabajo contra su modelo en lugar de sustituirlo por el mío.
¿Trabaja directamente en nuestro repositorio y CI?
Sí — todo llega como pull requests en su repositorio y como gates que se ejecutan en su CI, no como un sistema aparte que no puede ver. Cuando el proyecto termina, su equipo es dueño de todo ello y lo ejecuta.
¿Cómo colabora en remoto y entre husos horarios?
Totalmente en remoto y con prioridad asíncrona: el trabajo avanza mediante pull requests, actualizaciones escritas y un runbook compartido, de modo que nada depende de una llamada en directo. Mantengo horas de solapamiento para revisión y para desbloquear decisiones.
¿Cómo se acota y se cotiza el proyecto?
El alcance se fija a un entregable, como una auditoría, una suite de evaluación o un gate de CI, y se cotiza por proyecto en lugar de por hora. Usted aprueba el alcance antes de comenzar el trabajo, así que no hay un contador abierto.