Referencia
Glosario
Definiciones en lenguaje claro — sin jerga porque sí.
- Golden set — una colección curada de inputs reales emparejados con outputs acordados como correctos, usada como fuente de verdad para puntuar una funcionalidad de IA.
- LLM-as-judge — usar un modelo de evaluación para puntuar el output de otro modelo frente a criterios como fidelidad, relevancia y seguridad.
- Fidelidad / grounding — si una respuesta está realmente respaldada por su material fuente, en lugar de inventada.
- Alucinación — una respuesta segura y fluida que no es verdadera ni está fundamentada en ninguna fuente.
- Inyección de prompt — un input diseñado para que el modelo ignore sus instrucciones y haga otra cosa.
- Jailbreak — un intento de eludir las reglas de seguridad de un modelo, a menudo mediante un juego de rol o una falsa persona "sin reglas".
- CI quality gate — un check automatizado en tu pipeline que bloquea un merge o un deploy cuando un score de calidad cae por debajo de un piso.
- Ratchet — un gate cuyo piso de aprobación solo puede subir, para que la calidad no se erosione en silencio.
- Flake — un test que pasa y falla sin ningún cambio de código; las suites inestables entrenan a los equipos para ignorar el rojo.
- Golden run / evidencia — una corrida de test guardada y reproducible (trazas, capturas de pantalla) que demuestra un resultado.
- Human-in-the-loop — un diseño en el que una persona aprueba una acción de IA en un punto de riesgo definido.
- RAG — retrieval-augmented generation: fundamentar respuestas en documentos recuperados en lugar de en la memoria del modelo.
© 2026 Jason Teixeira · Sage Ideas LLC · Inicio de la documentación