EN·ES·PT
Portafolio · edición 2026 · construido y comprobado
Automatización de IA × Ingeniero de QA / evaluación de LLM N 28.5384° W 81.3789°

Yo lanzo funciones de IA. Luego demuestro que funcionan.

Soy a quien contratas cuando estás por lanzar una función de LLM que podría avergonzarte frente a un cliente. La construyo, y también la barrera que la detecta en el momento en que se desvía. ver por qué →

LLM apps y agentes, además de automatización de flujos de trabajo (RAG, LangGraph, n8n/Make), combinados con el conjunto de pruebas de regresión y evaluación que los mantiene honestos en producción: Playwright, Pytest, k6, Promptfoo, DeepEval, LLM-as-judge. La mayoría de las personas construye la IA o la prueba. Yo hago ambas cosas, y cada afirmación de abajo enlaza a una evidencia.

0/13 barreras de prueba · rojo→verde hoy
0 pruebas exitosas · 0% de cobertura de líneas
verificado · reproducible con un solo comando
un proyecto a la vez — actualmente agendando para Q4 2026
Reservar una llamada → Mini-evaluación gratuita de tu función de IA → Currículum (PDF) ↓ GitHub ↗

Cotizado por escrito antes de comenzar el trabajo. La tarifa de la auditoría se acredita al proyecto. Si no encajamos, no hay cargo.

fig. 01: una función falla la evaluación → regresa. ese es todo el punto.
evidencia de campo · en producción

Cualquiera puede construir una demo de IA ahora. Casi nadie puede demostrar que funciona en producción.

Esa brecha es todo el trabajo, y es la parte de la que tengo evidencia. Cuatro casos, cada uno enlazado a la ejecución textual.

10% → <1%
reducción de la tasa de pruebas inestables
en una suite de producción en vivo · HighStrike
el caso de estudio →
37/37
specs en verde en CI · 0 fallos intermitentes
15.3s · público, reproducible
la ejecución →
100%
de las respuestas de RAG citan una fuente
por construcción, no por prompt
captura de pantalla en vivo →
15 → 0
CVEs altos/críticos — mi propia
barrera los detectó, en mi propio repo
la ejecución en rojo →
01
01 · superficie de prueba
0
pruebas exitosas · verificado
0%
cobertura de líneas · piso creciente
0/13
barreras de prueba · desviación detectada y corregida hoy
nexural-qa-os · proof-loop.mjs · dos ejecuciones textuales · 2026-08-15

el asistente de ventas de este sitio también es sometido a red-teaming. ver los resultados 10/10 →

LangGraphMastran8nMakeZapierpgvectorSupabaseFastAPINext.jsPlaywrightPytestk6PromptfooDeepEvalLLM-as-judgeLangfuseGitHub Actions
LangGraphMastran8nMakeZapierpgvectorSupabaseFastAPINext.jsPlaywrightPytestk6PromptfooDeepEvalLLM-as-judgeLangfuseGitHub Actions
la transformación · qué hace esto por ti

Tu operación de hoy, convertida en un sistema que puedes demostrar.

Desplázate. El mismo flujo de cinco etapas, de manual-y-no-demostrable a automatizado-y-con-barrera-de-evaluación. La forma de lo que construyo para ti.

02
02 — el índice

Cinco sistemas, una sola tesis.

01
Agentes · Apps de LLMESTIMADO

sage-agents

Monorepo de almacén de agentes: agentes de voz, SDR saliente, chat de soporte con RAG, y orquestadores de flujos de trabajo sobre Mastra + LangGraph. Incluye un enrutador de LLM multiproveedor, seguimiento de costos por ejecución y trazabilidad con Langfuse, además de una barrera estricta de consentimiento TCPA en cada llamada saliente.

página en blanco → agente de cliente listo para staging en días en lugar de semanas (estimado a partir del tiempo de scaffolding de la plantilla)
MastraLangGraphVercel AI SDKSupabaseLangfuse
Privado · demostración guiada bajo solicitud
ingresoweb · teléfonoenrutador LLMcosto rastreadovozbarrera TCPASDRchat RAGLangfusecada ejecución trazada
~/sage-agents
$ pnpm tsx infra/scripts/create-agent.ts \
inbound-voice acme-inbound-voice
scaffolded @sage/agent-acme-inbound-voice
✓ prompts · tools · evals/golden.json ready
fig. 02 · arquitectura · salida en vivo
02
Flujo de trabajo autónomoVERIFICADO

sage-kernel

Sistema operativo de ingeniería MCP con enfoque proof-first: 140 herramientas que un agente de IA opera mediante políticas, aprobaciones firmadas y un libro de pruebas encadenado por hash. Nada está "terminado" solo porque un modelo lo diga. Un firewall de afirmaciones rechaza el lenguaje de éxito no comprobado.

140 herramientas MCP · 78 barreras de lanzamiento · verificado: suite de barreras + libro de pruebas encadenado por hash en el repositorio público
Node 22MCPSAST + taintSQLite/Postgres
agente de IAclaude · cursorpolíticaaprobaciones firmadas140 herramientasMCPlibro de pruebasencadenado por hash
~/sage-kernel
$ npm run mcp:smoke
passed, 140 tools
$ npm run release:check
✓ 78/78 gates · exit 0
fig. 03 · arquitectura · salida en vivo
03
RAGVERIFICADO

ai-research-dashboard

Base de conocimiento RAG donde cada respuesta es extractiva y está citada. Proceso de ingesta duradero, recuperación con pgvector, ejecuciones de evaluación persistidas y un registro de auditoría completo desde la fuente hasta la respuesta.

100% de cobertura de citas · verificado el 2026-08-15: se ejecutó en vivo, se hizo una pregunta real, la captura de pantalla de abajo es la respuesta real
FastAPIpgvectorGeminiReact
Privado · demostración guiada bajo solicitud
fuentesingesta duraderafragmentadorembeddingspgvectorcosine top-krespuesta citadaregistro de auditoría
El AI Research Dashboard real respondiendo una consulta con citas a nivel de fragmento: candidatos de recuperación clasificados y seleccionados, 100% de cobertura de citas, tasa honesta de abstención por falta de evidencia visible en la fila de métricas.
fig. 04 · arquitectura · UI real, consulta real, 2026-08-15 · clic para ampliar
04
Framework de QA + CIVERIFICADO

playwright-sdet-regression-suite

Flujos de e-commerce críticos para el lanzamiento, bajo pruebas de regresión, con la evidencia que pediría un gerente de lanzamientos: trazas, capturas de pantalla, cuatro reporters y un modelo de riesgo documentado. CI sube los artefactos en cada push.

37/37 specs · 15.3s · 0 pruebas inestables · verificado: carpeta evidence/ en el repositorio público, ejecución con fecha 2026-07-10
PlaywrightTypeScriptPOMGitHub Actions
push / PRCIGitHub Actions37 specs4 workers · POMbarrera en verdetrazas · 4 reporters
~/playwright-sdet-regression-suite
$ npx playwright test
Running 37 tests using 8 workers
37 passed (15.3s)
artifacts → evidence/ · traces · JUnit · screenshots
fig. 05 · arquitectura · salida en vivo
05
Suite de evaluación LLMVERIFICADO

nexural-qa-os

85 runners de calidad bajo un solo CLI, incluyendo evaluaciones de alucinación, jailbreak, inyección de prompts, toxicidad y fuga de PII para funciones de LLM. Cada puntuación se calcula a partir de un comando real y se empaqueta como evidencia firmada con ed25519.

3,759 pruebas · 91% de cobertura · 13/13 · verificado el 2026-08-15: la barrera de CVE se puso en rojo a las 11:39, bloqueó el lanzamiento, y estaba en verde a las 14:35. Ambas ejecuciones publicadas.
Turbo + pnpmvitestorquestador DAGed25519
ejecución en rojo ↗reejecución en verde ↗Privado · demostración guiada bajo solicitud
ejecución de QAun solo CLIDAGrunners de plugins85 runners10 de seguridad de IAveredictofirmado con ed25519
~/nexural-qa-os
11:39 ✗ 15 high/critical CVEs → NOT PROVEN 12/13
+9 security floors · pnpm install
14:35 ✓ 0 high/critical → PROVEN 13/13
# caught → blocked → patched → proven. same day.
fig. 06 · arquitectura · salida en vivo
03
03 · resúmenes de ingeniería

Cómo fue realmente el trabajo, en fichas técnicas que puedes auditar.

El resultado primero; la ficha técnica completa de ocho secciones — incluyendo las partes que la mayoría de los casos de estudio esconden — está a un clic de distancia. Cada cifra destacada indica cómo fue medida.

ficha BRIEF/01 · rev A
BRIEF/01

Triaje de feedback que se ejecuta solo

Flujo de trabajo con Make + Gemini

El feedback negativo ahora aparece en segundos. Antes esperaba hasta la revisión del viernes.

Google FormsMake webhookGemini 2.5 Flash · clasificar + resumirregistro en Sheets¿negativo? → alerta por correo
fig. 07 · flujo del sistema, de izquierda a derecha
Problema

El feedback de los clientes llegaba a través de un formulario y quedaba sin leer. Las señales negativas surgían días tarde, cuando el cliente ya se había ido.

Resultados medidos

El feedback negativo surge en tiempo real en lugar de en la revisión de fin de semana — medido como una latencia de webhook a alerta de segundos, frente a una revisión manual semanal.

ver ficha completa: 6 secciones más
Por qué no un chatbot

Nadie quiere conversar con su propia cola de feedback. El valor es determinista: clasificar, resumir, enrutar, alertar. Una interfaz de chat añadiría latencia y eliminaría la auditabilidad.

Arquitectura

Escenario de Make, cuatro pasos de principio a fin (ver fig. 1). Cada paso puede reejecutarse de forma aislada.

Recuperación / memoria

No se necesita ninguna. Cada mensaje se clasifica de forma independiente. Evitado deliberadamente: la ausencia de estado mantiene el pipeline depurable.

Puntos de aprobación humana

La IA nunca responde a un cliente. Enruta a un humano con un resumen; el correo de alerta es el traspaso. No resuelve nada por sí sola.

Salvaguardas de producción

Esquema de salida estructurada en el paso del LLM, etiqueta de respaldo ante fallos de parseo, y el mensaje original siempre registrado junto con la clasificación.

Qué reforzaría a continuación

Un conjunto dorado de mensajes etiquetados ejecutado cada noche a través de Promptfoo para detectar desviaciones de clasificación cuando cambia la versión del modelo.

stack · Make · Gemini 2.5 Flash · Google Forms · Sheets · Gmail
ficha BRIEF/02 · rev A
BRIEF/02

RAG que cita o se calla

ai-research-dashboard

El 100% de las respuestas cita su fuente. El pipeline no tiene ninguna ruta sin citar.

fuentefragmentadorembeddings → pgvectorrecuperación por cosenorespuesta extractiva + citasregistro de auditoría
fig. 08 · flujo del sistema, de izquierda a derecha
Problema

Los equipos de investigación necesitan respuestas de su propio corpus. Un sistema RAG que parafrasea con confianza sin fuentes es un pasivo, no una herramienta.

Resultados medidos

100% de las respuestas respaldadas por citas — verificado por diseño: no existe ninguna ruta de generación sin citar. Calidad, seguridad, latencia y costo se rastrean por consulta en el endpoint de analítica.

ver ficha completa: 6 secciones más
Por qué no un chatbot

Un wrapper de chat sobre el corpus era la construcción obvia. La necesidad real era un dashboard operativo: fuentes, trabajos de ingesta, ejecuciones de evaluación y feedback, todo inspeccionable. El Q&A es solo una función dentro de él.

Arquitectura

API en FastAPI + proceso de ingesta duradero que alimenta la fig. 1; un gateway de proveedores intercambia embeddings deterministas locales por Gemini según el entorno. Dashboard en React por encima.

Recuperación / memoria

Consultas, respuestas y citas persistidas. Eliminar una fuente se propaga en cascada: fragmentos, embeddings, trabajos, payloads, citas. Sin memoria huérfana.

Puntos de aprobación humana

Un endpoint de feedback a nivel de respuesta alimenta un ciclo de revisión; las ejecuciones de evaluación se disparan y persisten vía API para que un humano dé el visto bueno antes de lanzar cambios de proveedor o de umbral.

Salvaguardas de producción

Respuestas solo extractivas (citar o abstenerse), registro de auditoría completo sobre eventos de fuente/consulta/evaluación/feedback, proveedores locales deterministas para desarrollo reproducible, respaldo de Gemini a local cuando faltan claves.

Qué reforzaría a continuación

Convertir los umbrales de evaluación en barreras de despliegue para que una regresión de recuperación bloquee el lanzamiento antes de que llegue a la retro.

stack · FastAPI · pgvector · SQLite/Postgres · Gemini · React
ficha BRIEF/03 · rev A
BRIEF/03

El sistema operativo de QA que no puede mentir

nexural-qa-os

3,759 pruebas. El día de publicación, la barrera detectó una desviación real de CVE, me bloqueó, y volvió a estar en verde por la tarde.

qa init · detectar stackorquestador DAG85 runners · incl. 10 evaluaciones de seguridad de LLMveredicto calculadoevidencia firmada con ed25519
fig. 09 · flujo del sistema, de izquierda a derecha
Problema

Los dashboards de calidad muestran números que no pueden defender. Para las funciones de LLM es peor: los equipos lanzan cambios de prompt sin ninguna señal de regresión.

Resultados medidos

3,759 pruebas, 91.12% de cobertura de líneas, 13/13 barreras. El 2026-08-15, la barrera de CVE se puso honestamente en rojo (15 altos/críticos en dependencias) y bloqueó su propio lanzamiento — parchado y PROBADO de nuevo esa misma tarde, ambas ejecuciones publicadas textualmente. Un solo comando regenera el scorecard.

ver ficha completa: 6 secciones más
Por qué no un chatbot

Un "asistente de QA con IA" que opina sobre la calidad es exactamente el modo de falla. El veredicto debe ser calculado por código a partir de los códigos de salida de los comandos. Aquí, un LLM nunca califica su propia tarea.

Arquitectura

Un solo CLI que impulsa la fig. 1: cada runner es un plugin (detect → plan → run → collectEvidence); un runner colgado no puede detener toda una ejecución. Dos barreras: pre-commit de <15ms, barrera de merge de repositorio completo.

Recuperación / memoria

Un libro de evidencia en lugar de memoria: el comando exacto, el código de salida y la métrica interpretada de cada ejecución se registran en un libro de pruebas, reverificable sin conexión.

Puntos de aprobación humana

El ciclo de corrección autónomo está acotado. Solo corrige lo que el harness puede verificar, hace commit ante una mejora, revierte ante una regresión y se detiene ante un estancamiento honesto para revisión humana.

Salvaguardas de producción

Contrato anti-alucinación: ninguna puntuación sin una evidencia que la respalde. Pisos de cobertura crecientes, disciplina de omisión honesta, evidencia redactada y firmada con ed25519.

Cobertura de evaluación de LLM

Diez runners dedicados a la seguridad de IA: sesgo, consistencia, alucinación, jailbreak, inyección de prompts, rechazo, toxicidad, fuga de PII, costo, latencia. Ese es el harness que aporto a las funciones de LLM de mis clientes.

stack · TypeScript · Turbo/pnpm · vitest · Playwright · k6 · ed25519
04
04 — trabaja conmigo

Servicios empaquetados

Alcance fijo, entregables fijos, evidencia incluida. Cada oferta es una versión productizada de algo de los resúmenes de arriba.

¿Contratando a tiempo completo? Estas son las tres capacidades que aportaría a tu equipo desde el primer día, cada una respaldada por un sistema ya lanzado, arriba.

QA y arnés de evaluación para funciones de LLM

Tu función de LLM obtiene una suite de regresión: trazas doradas, puntuación LLM-as-judge para fidelidad y seguridad, y una barrera de CI que bloquea el despliegue cuando la calidad baja.

Suite de Promptfoo / DeepEval sobre tus patrones de tráfico reales
Runners de alucinación, inyección y toxicidad
Barrera de CI + scorecard que tu PM puede leer
evidencia: nexural-qa-os · 85 runners incl. 10 evaluaciones de seguridad de IA
Ver todos los detalles →

Automatización de pruebas + configuración de CI

Una suite de Playwright/Pytest con alcance basado en riesgo y la disciplina de evidencia de un gerente de lanzamientos: trazas, reportes, artefactos, conectados a GitHub Actions desde el primer día.

Modelo de riesgo → matriz de cobertura en lugar de un caos de scripts
Cuatro reporters, trazas en cada reintento, retención de artefactos
Línea base de carga con k6 en la ruta crítica
evidencia: playwright-sdet-regression-suite · 37/37 en CI
Ver todos los detalles →

Construcción de automatización de flujos de trabajo con IA

Una automatización funcional (recepción, triaje, enrutamiento, respuestas respaldadas por RAG) construida sobre n8n/Make o LangGraph, con puntos de aprobación humana donde corresponden y registros que puedes auditar.

n8n / Make / Zapier o LangGraph a nivel de código
Barreras human-in-the-loop, salidas estructuradas
Runbook + traspaso para que tu equipo se haga cargo
evidencia: plantillas de sage-agents · pipeline de triaje de feedback
Ver todos los detalles →
Ver la matriz completa de servicios: cada capacidad, con precio y visual
el camino del proyecto · cómo trabajamos juntos
01 · Auditoría
~1 semana · empieza aquí

Un solo cuello de botella de mayor impacto, mapeado. Te vas con un plan priorizado y una cotización concreta que es tuya.

Iniciar una conversación →
02 · Sprint
~2 semanas · con alcance y cotizado

Una mejora visible, de calidad de producción: lanzada, medida, en tu repositorio.

03 · Construcción
~4–8 semanas · con alcance y cotizado

El sistema completo: suite, barrera, automatización, runbook, propiedad de tu equipo al momento del traspaso.

04 · Operar
continuo · opcional

Medir, mejorar, publicar: el sistema se compone en lugar de decaer silenciosamente.

ficha OFFER/01 · precio fijo
OFFER/01

La Auditoría de Evaluación

$2,500

Una semana, precio fijo.

Someto tu función de IA en producción a una batería de evaluación real — corrección, seguridad, alucinación, inyección de prompts — y te entrego un reporte con puntuación, las transcripciones que fallaron, y una lista priorizada de correcciones. Los $2,500 se acreditan directamente al proyecto de construcción si decides continuar. La construcción en sí se cotiza según lo que revele la auditoría, así que sigues pagando por tu problema, no por un paquete.

El único entregable estandarizado y de precio fijo que vendo. Todo lo que viene después — la construcción — se mantiene con alcance y cotización según lo que revele la auditoría.
Cada proyecto se cotiza por escrito antes de comenzar el trabajo: alcance fijo, nunca horas abiertas. La tarifa de la auditoría se acredita directamente al proyecto de construcción si continúas. Si el scoping muestra que no puedo ayudar, te lo diré y no tendrá ningún costo.
un proyecto a la vez — actualmente agendando para Q4 2026
cómo transcurre un proyecto típico de 4 semanas
SEMANA 1
Alcance y mapa de riesgo
Tu función, tus modos de falla. Acordamos qué significa "funcionar" y cómo se medirá.
SEMANA 2–3
Construcción
La automatización, el agente o la suite: en tu repositorio, tu CI, tus convenciones.
SEMANA 3–4
Harness y barrera
Evaluaciones y regresión conectadas a CI. Una barrera en rojo bloquea el despliegue antes de que llegue a la retro.
TRASPASO
Runbook y evidencia
Documentación, scorecard y una demostración guiada para que tu equipo se haga cargo sin mí.
preguntas frecuentes
Ya tenemos QA. ¿Por qué contratarte a ti?

Tu equipo de QA casi seguro cubre la superficie determinista. La brecha está en la función de LLM: sin conjunto dorado, sin juez, sin barrera. Los cambios de prompt se lanzan a ojo. Yo añado la capa de evaluación a tu pipeline existente; tu equipo se hace cargo cuando me voy.

¿Trabajas en nuestro stack o en el tuyo?

En el tuyo. Tu repositorio, tu CI, tus convenciones. Cada proyecto termina con un runbook y una demostración guiada. El entregable es un sistema que tu equipo ejecuta sin mí. No hay ninguna dependencia hacia mí.

¿Cuánto cuesta un proyecto?

No hay una lista de precios fija, porque el alcance varía demasiado como para que una sea honesta. Cada proyecto se cotiza por escrito después de una breve llamada de scoping: alcance fijo, nunca horas abiertas. La llamada introductoria de 30 minutos es gratuita y termina con un plan concreto y una cifra real, en cualquier caso. Empieza con la auditoría y la cotización para la construcción más grande viene incluida.

¿Qué tan rápido puedes empezar?

Agendo un proyecto a la vez (ver la etiqueta de disponibilidad en la parte superior de la página). La semana 1 es de scoping, así que el riesgo de calendario es bajo: sabrás exactamente qué vas a obtener antes de que comience la construcción.

¿Cuál es el cronograma típico?

La auditoría dura una semana. Los sprints tipo piloto duran de 2 a 3 semanas; las construcciones completas, de 4 a 8, según el alcance. Cada proyecto entrega algo visible dentro de las primeras dos semanas. No hay fases largas y silenciosas.

¿Cómo manejas nuestros datos y código?

Compatible con NDA. El acceso se limita al alcance del proyecto, las credenciales permanecen en tus sistemas, el código permanece en tus repositorios, y nada se conserva después del traspaso. El resumen de una página sobre el manejo de datos está disponible antes de comenzar.

¿Qué pasa si las evaluaciones muestran que nuestra función de IA está bien?

Entonces lanzas con evidencia en lugar de esperanza. Esa es la victoria. La suite permanece en CI, detectando la regresión que habría llegado seis semanas después.

¿Puestos a tiempo completo?

Abierto al puesto correcto. El interruptor "Contrátame" en la parte superior reenfoca esta página para reclutadores, y el currículum en PDF está a un clic de distancia.

05
05 — acerca de
JT Jason Teixeira
Durante trece años mi trabajo fue asegurarme de que el software realmente funcionara. El tipo de QA donde un bug pasado por alto cuesta dinero de verdad. Luego las funciones de IA empezaron a lanzarse con una demo y una plegaria, y vi cómo buenos productos fallaban de maneras que el cliente descubría primero. Así que ahora construyo ambas mitades: la IA, y la prueba de que funciona.

— Jason Teixeira · fundador, Sage Ideas

Dirijo Sage Ideas, un estudio nativo de IA, y he pasado años construyendo lo mismo en cada capa: sistemas que se niegan a decir "listo" sin evidencia.

Esa tesis se manifiesta como un sistema operativo de ingeniería con un libro de pruebas encadenado por hash, una plataforma de QA donde cada puntuación se calcula a partir de un comando real, y pipelines de agentes con evaluaciones de trazas doradas conectadas a CI. El patrón siempre es el mismo: lanzar la función, y luego lanzar la maquinaria que la detecta cuando regresa.

Si tu equipo está lanzando funciones de LLM a ojo (sin suite de evaluación, sin barrera de regresión, sin idea de si el cambio de prompt de la semana pasada empeoró las cosas), esa es exactamente la brecha que cierro.

Construyo
LangGraph · agentes Mastra
RAG — pgvector · citas
flujos de n8n · Make · Zapier
Next.js · FastAPI · Supabase
agentes de voz — Retell · Vapi
JT un
ingeniero
Demuestro
Playwright · Pytest · k6
Promptfoo · DeepEval
LLM-as-judge — fidelidad
evaluaciones de jailbreak · inyección · PII
barreras de CI · evidencia firmada
capacidadconstructor de IA típicoingeniero de QA típicoyo
Lanza funciones de LLM (RAG, agentes, automatización)
Construye suites de evaluación y barreras LLM-as-judgeraroraro✓ lanzado
Disciplina de regresión en CI (Playwright/Pytest)✓ 13 años
Batería de seguridad de IA (inyección · PII · toxicidad)✓ 10 runners
Evidencia que puedes auditar (firmada, reproducible)raro✓ por diseño
Certificado para ello (ISTQB CT-AI + TAE)raro✓ ambas
06
06 — trayectoria

Rigor de Fortune 50, velocidad de fundador.

Trece años entre retail empresarial y fintech, además de un estudio nativo de IA. Cada puesto en la misma disciplina: automatización que demuestra que el software funciona. Currículum completo (PDF) ↓

Sage Ideas · Nexural

Fundador, Ingeniero de Automatización de IA y QA 2024 — presente · Orlando, FL / remoto
  • Construí todo lo del índice de arriba: el almacén de agentes, el sistema operativo de ingeniería proof-first, y una plataforma de QA de 85 runners con diez evaluaciones dedicadas de seguridad de LLM.
  • Nexural Research: 58 endpoints de FastAPI · 604 pruebas · 93% de cobertura, validación de respuestas de IA que contrasta las afirmaciones del modelo con métricas de origen deterministas.

HighStrike

Finanzas Cuantitativas y Automatización, Analista Senior / Full-Stack 2021 — 2026 · fintech, remoto
  • Infraestructura de pruebas basada en Kubernetes que ejecuta más de 500 pruebas contra flujos de trading en vivo (más de $100k de volumen diario); tasa de pruebas inestables reducida de 10% → <1% con reintento inteligente.
  • Tiempo de ejecución de pruebas de 45 min → 8 min (−82%) mediante contenedorización con Docker y ejecuciones paralelas entre microservicios.
ejecución de pruebas 45m → 8m

The Home Depot

Tester de Software → Ingeniero de Automatización → Ingeniero Cloud 2012 — 2021 · Fortune 50
  • Framework de Selenium + Python para sistemas que dan servicio a más de 2,300 tiendas: regresión 4 h → 75 min (−70%), más de 300 casos automatizados con 99.5% de estabilidad.
  • Lideré la migración empresarial a AWS (Terraform, Kubernetes): −35% en costo de infraestructura, despliegues 4 h → 15 min mediante pipelines de Jenkins/GitLab.
regresión 4h → 75m
despliegues 4h → 15m
certificaciones
ISTQB CT-AI — pruebas de IA ISTQB Test Automation Engineer ISTQB CTFL AWS Cloud Practitioner AWS ML Foundations TripleTen AI Automation
Lic. en Ciencias de la Computación, Full Sail · Lic. en Finanzas, Kean · Inglés y portugués nativo · Español profesional
07 — en números
13+
años en calidad y automatización
140
repositorios públicos en GitHub
85
runners de calidad construidos
78
barreras de lanzamiento, todas en verde
08
08 — notas de campo

Notas de trabajo desde las trincheras del proof-first.

2026·08Dieciocho agentes auditaron un currículo en vivo. Una lección estaba enseñando un error falso.Seis auditores ejecutando cada afirmación de código, seis reescritores, seis verificadores independientes. 73 defectos, 17 críticos o altos. Cada uno anclado a una cita textual. Trece minutos de tiempo real.5 min · leer →2026·08Cinco páginas, cinco agentes, un archivo de diseño: cero conflictos de mergeUna flota en paralelo lanzó cinco páginas de producción en cinco minutos de tiempo real. La velocidad es la demo; las tres reglas que lo hicieron lanzable son el producto.4 min · leer →2026·08El día en que mi propia barrera de calidad me bloqueóA las 11:39 el ciclo de pruebas rechazó el veredicto PROBADO. 15 CVEs se habían filtrado en las dependencias de producción. En verde a las 14:35. Ambas ejecuciones publicadas textualmente.4 min · leer →2026·08Pruebas de regresión de LLM con Promptfoo en CI: la barrera mínima viable30 trazas doradas, un juez, un código de salida de fallo. La configuración más pequeña que detiene un mal cambio de prompt, ejecutable esta misma tarde.6 min · leer →2026·08Sin verde falso: lo que un libro de pruebas me enseñó sobre los agentes de IALos agentes reportarán con gusto un éxito que nunca ganaron. Un mejor prompt no arreglaría esto. La solución es una barrera de evidencia que el agente físicamente no puede sortear hablando.6 min · leer →2026·07Tu función de LLM necesita una suite de regresión más que un mejor promptLos ajustes de prompt se sienten como progreso porque nadie está midiendo. Las trazas doradas + LLM-as-judge en CI convierten el "parece mejor" en un diff sobre el cual puedes poner una barrera.5 min · leer →2026·06Automatización que nunca le habla a tu clienteEl flujo de trabajo de IA con mejor conversión que he lanzado envía cero mensajes escritos por IA. Dónde colocar el punto de aprobación humana, y por qué supera a la autonomía total.4 min · leer →

los escritos más extensos viven en sageafterdark.com · recurso gratuito: la lista de verificación de evaluación previa al lanzamiento de LLM →

Hagamos que tu IA sea demostrable.

30 minutos. Trae la función que te da miedo. Sal con un plan concreto de evaluación y automatización.

Una contratación, dos disciplinas.

El ingeniero que lanza la función de LLM y el harness que la protege. Hablemos de tu equipo.

Reservar una llamada introductoria → o simplemente escríbeme Escríbeme
Cada proyecto se cotiza por escrito antes de comenzar el trabajo: alcance fijo, nunca horas abiertas. La tarifa de la auditoría se acredita directamente al proyecto de construcción si continúas. Si el scoping muestra que no puedo ayudar, te lo diré y no tendrá ningún costo.
un proyecto a la vez — actualmente agendando para Q4 2026
mini-evaluación gratuita · una muestra de trabajo que te queda

Envíame tu función de IA. Ejecutaré una mini-evaluación gratuita sobre ella y te enviaré los hallazgos: aprobado/reprobado, ejemplos de fallos, y qué pondría como barrera antes de tu próximo lanzamiento. No se requiere llamada.

usa el formulario de abajo; coloca la URL de la función en el mensaje y elige cualquier etapa

Yo mismo respondo dentro de un día hábil. No hay ninguna secuencia automatizada.

1 — llamada introductoria

30 minutos, gratis. Trae la función que te da miedo.

2 — mapa de riesgo

Semana 1: acordamos qué significa "funcionar" y cómo se mide.

3 — cotización fija

Precio ligado a entregables en lugar de horas abiertas. De cualquier forma, el plan es tuyo.

github/JasonTeixeira linkedin sageideas.dev
TEIXEIRA
copiado