Cálculo de tokens en agentes conversacionales: propuesta metodológica con modelo contable por turno
16 de septiembre de 2026 · Santiago Raúl Díaz · 1 min de lectura · Actualizado el
Los agentes conversacionales basados en modelos de lenguaje de gran tamaño (LLM) se facturan por token, pero la mayor parte de los tokens pagados no la escribe el usuario: proviene del historial reenviado, de las instrucciones de sistema, de los esquemas de herramientas, de la recuperación de documentos y del razonamiento interno. Este trabajo propone una metodología para estimar ex ante y verificar ex post el consumo de tokens y su costo. Su núcleo es un lema de transcripción acumulativa —cada token que ingresa al historial se paga una vez por cada llamada posterior— que rige a tres escalas: llamadas a herramientas dentro de un turno, turnos de una conversación y rondas de un sistema multiagente. Del lema se derivan formas cerradas para cuatro políticas de contexto, la fracción cacheable del prompt, el efecto de la expiración de la caché, una corrección por heterogeneidad del número de turnos basada en su segundo momento factorial y los multiplicadores por reintentos. La metodología se completa con un modelo físico de precio por token para despliegues propios y con un protocolo de validación que incluye pruebas de equivalencia, tamaño muestral por potencia, corrección por comparaciones múltiples y un estimador de la tasa de divergencia numérica a temperatura cero. Un caso analítico muestra que una conversación de 40 turnos factura 21,3 veces su contenido nuevo, que la caché de prefijo desplaza de 6 a 76 turnos el punto en que conviene resumir el historial y que planificar con el número medio de turnos subestima el costo en un 30 %. Las cifras son ilustrativas; la contribución es la estructura verificable del cálculo.
PAPER COMPLETO: METODOLOGIA_DE_CALCULO_PARA_AGENTES_-_RD___possitionIA.docx.pdf