Detalles del Artículo
La economía unitaria real de un agente de IA
La mayoría de los business cases de IA se construyen con una calculadora de tokens. Tokens de entrada por precio, tokens de salida por precio, multiplicado por volumen previsto, presentado al consejo. La cifra siempre sale alentadoramente pequeña y casi nunca es el coste real.
Las líneas que faltan
- Reintentos y reparación. El tráfico real produce salidas mal formadas, timeouts y negativas. Presupuesta entre un 15% y un 30% más de llamadas de las que sugiere el camino feliz.
- Recuperación. Generar embeddings, almacenarlos y regenerarlos es un coste recurrente que crece con tu contenido, no con tu uso.
- Crecimiento del contexto. Las conversaciones se alargan, los prompts acumulan instrucciones y el coste por llamada sube en silencio trimestre a trimestre.
- Fallback humano. Cada caso escalado cuesta tiempo de soporte. Con un 20% de escalado en una tarea que una persona resuelve en seis minutos, la línea humana suele superar con creces la de tokens.
- Evaluación. Ejecutar tu batería de regresión en cada cambio es cómputo que pagas y tiempo de ingeniería que planificas.
La latencia es un coste, no una petición de mejora
Una respuesta de nueve segundos no es una versión más lenta de una de dos segundos: es un producto distinto con otra tasa de abandono. Si tu agente vive en un checkout o en un chat de soporte, la latencia del modelo se convierte directamente en pérdida de conversión, y eso pertenece a la misma hoja de cálculo que la factura de la API.
La pregunta del punto de equilibrio
Para un caso de automatización el cálculo es sencillo y conviene hacerlo antes de construir nada: cuánto cuesta hoy la tarea en minutos humanos totalmente cargados, qué fracción puede resolver el agente solo y cuánto cuesta el resto con el sobrecoste del escalado. Si automatizar el 60% ahorra menos de lo que cuesta operar y mantener, la respuesta honesta es arreglar el proceso.
Un agente que resuelve el 60% de una tarea perfectamente y entrega el resto con limpieza gana a uno que intenta el 100% y se equivoca el 15% de las veces. El segundo diseño paga sus errores dos veces.
Qué incluimos en la estimación
Cuando dimensionamos una funcionalidad de IA, el modelo de coste va con la propuesta: coste por resultado correcto en tres niveles de volumen, tasa de escalado esperada y el punto en el que un modelo más pequeño o una ruta cacheada sale más barata. Es un artefacto aburrido y es la razón de que estos proyectos sobrevivan a su primera factura.
Nuestras Noticias
Cómo elegir tu primer flujo de trabajo con IA: una tarjeta de puntuación
Seis criterios, puntuados del uno al cinco. Por debajo de veinte es un segundo proyecto, no un primero.
El discovery pagado de dos semanas que reduce el riesgo de un gran proyecto
Las propuestas gratuitas están hechas para ganar el trabajo, no para acertar. Un discovery pagado es el seguro más barato que puede comprar un fundador.
Precio cerrado, por horas o equipo dedicado: cuál te protege
Cada modelo de contrato mueve el riesgo a algún sitio. Dónde lo pone cada uno y las cláusulas que importan más que el propio modelo.
Funcionalidades de IA que tocan datos de clientes: la base de cumplimiento
Antes de que tu agente lea un solo registro de cliente, deben existir siete controles. Se construyen en días y se retrofitean en años.