El método eval
El método eval
Una breve filosofía y luego cuatro guías en profundidad. Todo el método se reduce a una idea: reemplazar las opiniones sobre la calidad de la IA con puntuaciones calculadas a partir de comandos reales.
#Las cuatro piezas móviles
- Un golden set — entradas reales emparejadas con salidas acordadas como correctas, versionado junto al código. Esta es la fuente de la verdad.
- Un juez — un modelo de evaluación (o una verificación determinista) que puntúa cada salida en fidelidad, relevancia y seguridad.
- Sondas de seguridad — entradas adversariales que intentan romper la función tal como lo haría un usuario real o un atacante.
- Un gate de CI — la suite se ejecuta en cada cambio; una puntuación por debajo del umbral mínimo, que solo sube, bloquea el merge.
#Los principios
- Calculado, no afirmado. Una puntuación proviene de un comando que cualquiera puede volver a ejecutar — nunca de una opinión.
- Que suba, no que apenas pase. El umbral solo puede subir, para que la calidad no se erosione en silencio con el tiempo.
- Reduce la revisión humana con evidencia. Empieza con un humano en el circuito; elimina puntos de aprobación solo cuando los evals demuestren que es seguro.
- Nada de verde falso. Si el gate debería estar en rojo, se pone en rojo — públicamente. (El propio tablero de puntuación de este sitio funciona igual.)
▸
Análisis en profundidad, cada uno con un diagrama animado: El CI eval gate · Sondas de seguridad · Golden sets y jueces · Aprobación humana.
Míralo en acción
El eval en vivo califica una IA en tiempo real — presiona ejecutar y mira cómo falla las sondas.
© 2026 Jason Teixeira · Sage Ideas LLC · Inicio de la documentación