Casi todo el mundo calcula el coste de un asistente de IA multiplicando el precio por consulta por el número de consultas. Ese cálculo da un número tranquilizador que luego no se parece a la factura. Esto es lo que se paga en realidad.
No pagas por la pregunta, pagas por la conversación entera
Un modelo de lenguaje no recuerda nada entre un mensaje y el siguiente. Para que responda con contexto hay que volver a mandarle la conversación completa en cada turno: las instrucciones, el catálogo o los datos que necesite, y todos los mensajes anteriores.
La consecuencia es que el coste de una conversación no crece de forma lineal, crece con cada turno, porque cada turno reenvía todo lo anterior. El mensaje número diez cuesta bastante más que el primero aunque sea igual de corto.
En nuestras propias mediciones sobre el asistente que atiende WhatsApp, el historial acumulado es con diferencia la mayor parte de lo que se paga en cada turno. La pregunta del cliente y la respuesta apenas pesan.
Unas pocas conversaciones se llevan la mayor parte
El gasto no se reparte de forma pareja. Al revisar el nuestro nos encontramos con que una minoría de conversaciones concentraba la mayoría del consumo: hilos muy largos, con muchas idas y vueltas, que además solían ser los que peor acababan.
Eso tiene una lectura práctica. Vigilar el gasto medio por conversación no sirve de nada, porque la media esconde precisamente los casos que hay que mirar. Hay que mirar los extremos.
El descuento que casi nadie llega a cobrar
Los proveedores ofrecen un descuento notable cuando el principio de la petición se repite igual entre llamadas, porque pueden reaprovechar ese trabajo en lugar de rehacerlo. Es de los ahorros más grandes disponibles y es fácil perderlo entero sin enterarse.
Basta con que algo cambie al principio del texto en cada llamada. Nos pasó con la hora actual: iba en las primeras líneas de las instrucciones, cambiaba a cada minuto y por tanto el comienzo nunca era idéntico al de la llamada anterior. El descuento no se aplicaba nunca.
La corrección es de orden: lo que no cambia va primero y lo que cambia va al final. Cuesta un rato y no se nota en la calidad de las respuestas, solo en la factura.
Dónde se va el dinero, por orden
- El historial de la conversación: lo que más pesa y lo que menos se vigila. Se contiene resumiendo los turnos antiguos en lugar de arrastrarlos enteros.
- Las instrucciones del sistema: se escriben una vez y crecen sin que nadie las revise. Cada línea se paga en cada mensaje de cada conversación.
- Los datos que se adjuntan: mandar el catálogo completo cuando bastaría con los cinco productos relevantes multiplica el coste de cada turno.
- Los reintentos: cada reintento se factura. Un fallo silencioso que reintenta varias veces se paga varias veces.
Qué medir
Antes de intentar optimizar conviene poder responder a tres preguntas con datos, no de memoria: qué se gasta por conversación, qué proporción de ese gasto es historial acumulado, y qué porcentaje de las llamadas está aprovechando el descuento por repetición.
Sin esas tres respuestas, cualquier ajuste es a ciegas. Con ellas, en general se ve enseguida que el problema está concentrado en un sitio concreto.
La decisión que casi nadie plantea
Hay conversaciones que no deberían llegar al modelo. Una pregunta por el horario de apertura, una consulta de estado de un pedido o un saludo se resuelven con una respuesta fija o con una consulta a la base de datos, más rápido y sin coste variable.
Reservar el modelo para lo que de verdad necesita entender lenguaje suele bajar la factura más que cualquier ajuste técnico, y de paso mejora los tiempos de respuesta.
Acceso equipo