Detalles del Artículo

La economía unitaria real de un agente de IA
StartupsIACrecimiento

La economía unitaria real de un agente de IA

Volver

La mayoría de los business cases de IA se construyen con una calculadora de tokens. Tokens de entrada por precio, tokens de salida por precio, multiplicado por volumen previsto, presentado al consejo. La cifra siempre sale alentadoramente pequeña y casi nunca es el coste real.

Las líneas que faltan

  • Reintentos y reparación. El tráfico real produce salidas mal formadas, timeouts y negativas. Presupuesta entre un 15% y un 30% más de llamadas de las que sugiere el camino feliz.
  • Recuperación. Generar embeddings, almacenarlos y regenerarlos es un coste recurrente que crece con tu contenido, no con tu uso.
  • Crecimiento del contexto. Las conversaciones se alargan, los prompts acumulan instrucciones y el coste por llamada sube en silencio trimestre a trimestre.
  • Fallback humano. Cada caso escalado cuesta tiempo de soporte. Con un 20% de escalado en una tarea que una persona resuelve en seis minutos, la línea humana suele superar con creces la de tokens.
  • Evaluación. Ejecutar tu batería de regresión en cada cambio es cómputo que pagas y tiempo de ingeniería que planificas.

La latencia es un coste, no una petición de mejora

Una respuesta de nueve segundos no es una versión más lenta de una de dos segundos: es un producto distinto con otra tasa de abandono. Si tu agente vive en un checkout o en un chat de soporte, la latencia del modelo se convierte directamente en pérdida de conversión, y eso pertenece a la misma hoja de cálculo que la factura de la API.

La pregunta del punto de equilibrio

Para un caso de automatización el cálculo es sencillo y conviene hacerlo antes de construir nada: cuánto cuesta hoy la tarea en minutos humanos totalmente cargados, qué fracción puede resolver el agente solo y cuánto cuesta el resto con el sobrecoste del escalado. Si automatizar el 60% ahorra menos de lo que cuesta operar y mantener, la respuesta honesta es arreglar el proceso.

Un agente que resuelve el 60% de una tarea perfectamente y entrega el resto con limpieza gana a uno que intenta el 100% y se equivoca el 15% de las veces. El segundo diseño paga sus errores dos veces.

Qué incluimos en la estimación

Cuando dimensionamos una funcionalidad de IA, el modelo de coste va con la propuesta: coste por resultado correcto en tres niveles de volumen, tasa de escalado esperada y el punto en el que un modelo más pequeño o una ruta cacheada sale más barata. Es un artefacto aburrido y es la razón de que estos proyectos sobrevivan a su primera factura.