← Notas

EvaluaciónIA sin humo #06

¿Y cómo saben que funciona?

“¿Y cómo saben que funciona?”

Es la pregunta que más silencios incómodos genera en proyectos de IA. Y la respuesta honesta, en la mayoría de los equipos, es: “lo probamos y se veía bien”.

Así se itera en casi todos lados: se cambia el prompt, se miran tres salidas, “mejoró”, deploy. Eso no es ingeniería — es artesanía con suerte. Porque “se ve mejor” con tres ejemplos es compatible con haber empeorado en los otros cuarenta casos que nadie volvió a mirar.

Evaluar un sistema de IA no requiere un laboratorio. Requiere tres decisiones:

  1. Un golden set: 30-100 casos REALES de tu dominio, con la salida esperada escrita. No sintéticos, no inventados un viernes: casos que dolieron.

  2. Una métrica definida ANTES de mirar resultados. Exactitud, cobertura, formato válido — la que sea, pero escrita antes, porque después de ver las salidas todos encontramos la métrica que nos da la razón.

  3. Correr TODO el set en CADA cambio. De prompt, de modelo, de temperatura. Un prompt es código: sin regression tests, cada “mejora” es una apuesta.

¿Y cuando la salida no tiene una respuesta exacta —un resumen, una explicación—? Ahí entra usar un LLM como juez, una técnica que ya tiene su literatura seria (Zheng et al. 2023, el paper detrás de MT-Bench y Chatbot Arena). Con una advertencia que casi nadie repite: el juez también tiene sesgos medidos — prefiere respuestas largas, prefiere la primera opción que le muestran. Al auditor también hay que auditarlo.

El malentendido de fondo es creer que evaluar es lento, un lujo de investigadores. Es exactamente al revés: el golden set es lo que te deja cambiar un prompt un viernes a la tarde SIN MIEDO. Sin evals, cada cambio es una negociación con la ansiedad; con evals, es un número que sube o baja. La evidencia no es el freno de la iteración — es el pedal.

Hay otro motivo, más urgente, por el que esto no es opcional: tu sistema cambia aunque vos no lo toques. Los proveedores actualizan modelos, deprecan versiones, ajustan comportamientos. Sin un golden set corriendo, el día que el modelo cambie abajo tuyo te vas a enterar por un cliente.

Empezá mañana, en serio: juntá 30 casos reales hoy, escribí la métrica antes de correr nada, y automatizá la corrida. Es una tarde de trabajo. Te compra meses de iterar con confianza.

Para reproducirlo

Notebook05_eval_minima.ipynb Próximamente

Papers

Sigue en