La superficie de fallo
Lo que los tests unitarios pasan por alto — y lo que lo atrapa.
Cada fila es un modo de fallo que un test unitario de un solo turno estructuralmente no puede observar, emparejado con la sonda que sí lo hace.
Método, no dependencia de un proveedor. Las mismas tres familias — sondas golden multiturno, una batería de red-team y ejecuciones de repetición/robustez — se aplican a LangGraph, a un bucle personalizado o a un framework de agentes listo para usar.
preguntas frecuentes
Preguntas, respondidas.
¿Por qué es más difícil testear agentes que un solo prompt?
Ejecutan acciones de múltiples pasos con herramientas y memoria, así que los fallos se acumulan a lo largo de los pasos y la misma entrada puede seguir caminos distintos. Se testea la trayectoria completa, no solo la respuesta final.
¿Qué verifica usted realmente en un agente?
La corrección de las llamadas a herramientas, el comportamiento de bucle y terminación, el cumplimiento de las barreras de protección, el coste y la latencia, y la recuperación tras un mal paso — además del resultado de extremo a extremo.
¿Funciona esto con LangGraph o con un bucle personalizado?
Sí. Las mismas familias de chequeos valen para LangGraph, para un bucle de agente personalizado o para otro framework; conecto el harness a su implementación.
¿Puede bloquear los despliegues según las evaluaciones del agente?
Sí. La evaluación del agente se ejecuta en CI y bloquea cualquier lanzamiento que provoque una regresión en las trayectorias que importan.
¿Qué frameworks de agentes admite — LangGraph, CrewAI o un bucle personalizado?
Todos ellos. Los chequeos apuntan a la trayectoria del agente, no al framework, así que LangGraph, CrewAI y los bucles hechos a mano se conectan de la misma manera. Adapto el harness a cualquier runtime que ya tenga en marcha.
¿Cómo bloquea un despliegue según el comportamiento del agente sin bloquear cada lanzamiento?
La evaluación se ejecuta en CI contra un conjunto fijo de trayectorias golden y solo bloquea cuando el comportamiento sufre una regresión en ellas. El no determinismo se maneja con bandas de tolerancia y ejecuciones repetidas, de modo que un lanzamiento en buen estado se publica y una regresión real lo detiene.
¿Cómo son los plazos de un encargo típico?
Comienza con una fase corta de alcance para mapear las trayectorias críticas de su agente, luego una fase de construcción de las sondas golden y la batería de red-team, y después la entrega con el harness conectado a CI. El trabajo se concentra al inicio; el harness sigue funcionando cuando yo ya no estoy.
¿Qué recibo realmente al final del encargo?
Un harness de tests funcionando en su repositorio — sondas golden, una batería de red-team y bloqueo en CI — más un informe escrito de los modos de fallo encontrados y cómo se atrapa ahora cada uno. Todo es suyo para ejecutar y ampliar sin mí.
¿Cómo testea agentes que llaman a herramientas y APIs externas?
Las llamadas a herramientas se ejercitan contra fakes controlados y fixtures grabados para que los tests sigan siendo deterministas, y luego se verifican puntualmente contra la integración en vivo. Eso atrapa las llamadas malformadas, los argumentos incorrectos y los errores de herramienta mal gestionados antes de que lleguen a producción.
¿Cómo se define el alcance y se cotiza un encargo de testing de agentes?
El alcance se ajusta a la superficie de su agente — el número de trayectorias, herramientas y barreras de protección que necesitan cobertura — y el precio es una cotización fija por alcance acordado. Usted recibe la estimación antes de que comience cualquier trabajo, sin un contador de horas en marcha.