EN·ES·PT
JTjason.teixeira() Docs
servicios Reservar una llamada →
Inicio / Docs / El método eval / El método eval
El método eval

El método eval

Una breve filosofía y luego cuatro guías en profundidad. Todo el método se reduce a una idea: reemplazar las opiniones sobre la calidad de la IA con puntuaciones calculadas a partir de comandos reales.

#Las cuatro piezas móviles

  1. Un golden set — entradas reales emparejadas con salidas acordadas como correctas, versionado junto al código. Esta es la fuente de la verdad.
  2. Un juez — un modelo de evaluación (o una verificación determinista) que puntúa cada salida en fidelidad, relevancia y seguridad.
  3. Sondas de seguridad — entradas adversariales que intentan romper la función tal como lo haría un usuario real o un atacante.
  4. Un gate de CI — la suite se ejecuta en cada cambio; una puntuación por debajo del umbral mínimo, que solo sube, bloquea el merge.

#Los principios

  • Calculado, no afirmado. Una puntuación proviene de un comando que cualquiera puede volver a ejecutar — nunca de una opinión.
  • Que suba, no que apenas pase. El umbral solo puede subir, para que la calidad no se erosione en silencio con el tiempo.
  • Reduce la revisión humana con evidencia. Empieza con un humano en el circuito; elimina puntos de aprobación solo cuando los evals demuestren que es seguro.
  • Nada de verde falso. Si el gate debería estar en rojo, se pone en rojo — públicamente. (El propio tablero de puntuación de este sitio funciona igual.)
Análisis en profundidad, cada uno con un diagrama animado: El CI eval gate · Sondas de seguridad · Golden sets y jueces · Aprobación humana.
Míralo en acción
El eval en vivo califica una IA en tiempo real — presiona ejecutar y mira cómo falla las sondas.
Reservar una llamada →
© 2026 Jason Teixeira · Sage Ideas LLC · Inicio de la documentación