El chatbot que recomendé no lanzar
En simple
Un asistente sobre normativa interna funcionaba perfecto en la demo. Al medirlo con casos reales, fallaba justo en las preguntas que importaban. Recomendé no lanzarlo todavía, y fue la mejor decisión del proyecto.
01 · Problema
Un área quería un asistente que respondiera consultas sobre normativa interna. La demo con cinco preguntas elegidas salió perfecta, la sala aplaudió y ya había fecha de lanzamiento.
02 · Enfoque
Antes de lanzar armamos un golden set con 60 consultas reales del último año, separadas por tipo. El asistente respondía bien las generales y fallaba en las de normativa vigente: mezclaba versiones viejas y nuevas de los mismos documentos, y lo hacía con total seguridad.
03 · Qué pasó, paso a paso
- Fuente
- Control de calidad
- Modelo
- Salida
- 1Demo con 5 preguntas elegidas: perfecta
- 2Golden set con 60 consultas reales
- 3Medición por tipo de consulta
- 4Falla en normativa vigente: versiones mezcladas
- 5Decisión: no lanzar y ordenar los documentos primero
Qué se mide
- 5/5preguntas bien en la demoDatos ilustrativos
- 60consultas reales en el golden setDatos ilustrativos
Ver los datos
| Categoría | Valor | Nota |
|---|---|---|
| Consultas generales | 93 % | |
| Procedimientos | 85 % | |
| Normativa vigente | 58 % | la que importaba |
04 · Resultado
No se lanzó en la fecha prevista. El presupuesto fue a ordenar y versionar los documentos. Lo que aprendí: la demo optimiza la sensación de calidad; el golden set, la calidad. Y decir "todavía no" también es un entregable.