preguntas frecuentes
Preguntas, respondidas.
¿Qué es, concretamente, una evaluación de LLM?
Una forma repetible de puntuar la salida de su modelo — precisión, fidelidad, seguridad — frente a casos de referencia validados, de modo que un cambio de prompt o de modelo que empeore las cosas se detecte antes de que llegue a producción.
¿Cuántos casos de prueba se necesitan para empezar?
Normalmente de 50 a 200 casos representativos — suficiente señal para poner un gate — que se amplían a medida que aparecen modos de fallo reales en producción.
¿Pueden poner un gate en nuestro CI según los resultados de la evaluación?
Sí. La evaluación se ejecuta en CI y bloquea el merge si un umbral registra una regresión (cobertura de citas, tasa de alucinación, resistencia a inyección). En rojo antes de producción, no después.
¿Qué frameworks y modelos utiliza?
Agnóstico del proveedor — Promptfoo, DeepEval y Pytest contra una interfaz estándar de chat-completions, usando sus modelos y sus cuentas siempre que sea posible.
¿Qué tan grande debe ser el golden dataset para que sea útil?
Unas pocas docenas de casos bien elegidos superan a cientos de casos aleatorios. Empiece con los modos de fallo que de verdad le hacen daño — prompts reales de usuarios, casos límite, incidentes pasados — y haga crecer el conjunto a medida que aparecen nuevos fallos.
¿La puntuación con LLM como juez es lo bastante fiable para poner un gate?
No por sí sola. Los prompts del juez se validan con casos etiquetados por humanos, y el gate se apoya en verificaciones deterministas — coincidencia exacta, presencia de citas, esquema, detección de rechazo — siempre que la respuesta lo permita, reservando el juez para los casos genuinamente subjetivos.
¿Cómo encaja el gate de evaluación en el CI que ya ejecuto?
Se ejecuta como una verificación más en su pipeline existente — un paso en GitHub Actions o lo que use — que aprueba o falla el build. No hay que adoptar una plataforma nueva; la evaluación vive junto a sus pruebas unitarias y bloquea el merge con la misma X roja.
¿Qué le pasa al gate cuando cambio de modelo o edito un prompt?
Para eso existe exactamente. Cualquier cambio de modelo o edición de prompt vuelve a ejecutar la suite completa, y un cambio que registre una regresión en grounding, seguridad o calidad de respuesta pone el build en rojo antes de que llegue a los usuarios.
¿Lo construye en mi repositorio o en una herramienta aparte?
En su repositorio. La suite, el golden set y la configuración de CI se versionan junto a su código, así que usted lo posee, lo ejecuta y lo amplía sin depender de mí ni de un dashboard alojado.
¿Cuánto tarda en estar activo el primer gate de calidad?
El primer gate en funcionamiento — un golden set pequeño conectado a CI y bloqueando sobre un umbral real — llega pronto, y la suite gana profundidad a partir de ahí. Verá un build ponerse en rojo ante un mal cambio antes de que termine el trabajo, no una diapositiva sobre ello.