golden --evaluar

Golden, medido

Golden responde preguntas sobre este sitio (está abajo a la derecha). Esta página muestra cómo se lo evalúa, qué tan bien le va y qué todavía no sabemos. Es lo mismo que hago con los sistemas de IA de mis clientes, aplicado a mí.

Última evaluación: 8 de octubre de 2026 · llama-3.1-8b-instruct-fp8 · prompt golden-v2. Datos reales, no ilustrativos.

Última evaluación, métrica por métrica32 preguntas · llama-3.1-8b-instruct-fp8 · prompt golden-v2
Responde lo que está en el sitio
100 %
Cita la página correcta
100 %
Usa citas [n] en el texto
71 %
Fidelidad a las fuentes
94 %según el juez
Respuestas 100 % fieles
79 %según el juez
Se abstiene cuando no sabe
100 %
Ver los datos
CategoríaValorNota
Responde lo que está en el sitio100 %
Cita la página correcta100 %
Usa citas [n] en el texto71 %
Fidelidad a las fuentes94 %según el juez
Respuestas 100 % fieles79 %según el juez
Se abstiene cuando no sabe100 %

Costo de cada respuesta: 27 neuronas de Workers AI (≈ USD 0,0003). Cuando Golden no encuentra la respuesta, no llama al modelo: no gasta.

Cómo se mide

  1. Un golden set. 24 preguntas cuya respuesta está en el sitio, cada una con la página que debería encontrar, y 8 que no tienen nada que ver (una receta de empanadas, el mundial, un intento de hacerle olvidar sus reglas). Ahí lo correcto es decir "no lo encuentro".
  2. La búsqueda, por separado. Encuentra la página correcta en primer lugar el 88 % de las veces, y entre las tres primeras el 100 %. Con esas mismas preguntas se eligió desde qué parecido responde y debajo de cuál se abstiene (umbral 0,4).
  3. Las respuestas, como las ve un visitante. Se le hace cada pregunta y se mide si cita la página correcta, si usa citas, si se abstiene cuando debe y cuánto tarda.
  4. Un juez. Otro modelo (gpt-oss-120b, más grande y de otra familia que el que responde, para que no se dé la razón a sí mismo) separa cada respuesta en afirmaciones y verifica una por una si están en la fuente. También marca si Golden habla como si fuera Dani o promete algo que el sitio no dice.
  5. Al juez también se lo controla. La comparación del juez con la revisión a mano de Dani está en curso: hasta entonces, la fidelidad es la opinión de un modelo, no un hecho.

Lo que todavía no sabemos

Historial

Cada cambio de modelo o de prompt se evalúa con las mismas preguntas antes de publicarse.

FechaModeloPromptPágina correctaFidelidadAbstención1.ª palabra
8 de octubre de 2026llama-3.1-8b-instruct-fp8golden-v2100 %94 %100 %1,5 s

¿Tu sistema de IA tiene estos números?

Si no sabés cuánto acierta, cuánto inventa ni cuánto cuesta cada respuesta, eso es lo primero que miro en una Revisión LLMOps.