LAS IDEAS CLAVE
- 01
Define una tarea aceptada y conserva en el costo los fallos, reintentos y recursos compartidos atribuibles.
- 02
Acompaña el costo unitario con calidad, volumen pendiente, tiempo de respuesta y revisión humana.
- 03
Prueba caché y lotes según el comportamiento real del flujo; un descuento técnico no demuestra ahorro total.
Definir qué significa una tarea resuelta
Para estimar cuánto cuesta una aplicación de inteligencia artificial, proponemos relacionar el gasto con tareas que cumplen un criterio de aceptación. Una llamada al modelo puede producir un borrador, requerir correcciones o terminar sin resolver la solicitud. La unidad elegida debe permitir distinguir esos resultados y observar cuánto trabajo queda pendiente.
La FinOps Foundation, en su guía de optimización y previsión de costos de IA, plantea vincular el costo por unidad de trabajo con el valor empresarial esperado. Como aplicación editorial de ese principio, sugerimos calcular: costo operativo atribuible al conjunto de solicitudes dividido por tareas aceptadas. Antes de usar esa razón, negocio y tecnología deben acordar el alcance del costo y qué evidencia permite aceptar cada tarea.
Reconstruir el costo completo de la operación
La documentación de precios de Anthropic distingue tokens de entrada, salida y operaciones de caché. Los tokens son unidades con las que el modelo procesa contenido. La misma documentación explica que las herramientas pueden añadir consumo de tokens y, en algunos servicios ejecutados por el proveedor, cargos por uso. Esto muestra por qué una tarifa aislada no describe toda la ejecución de un flujo.
El documento de FinOps también incluye cómputo, almacenamiento, bases de datos y red entre los componentes de una aplicación de IA. Recomendamos inventariar esos servicios y asignar una parte de los recursos compartidos mediante una regla explícita. Los consumos de solicitudes fallidas y reintentos deben permanecer dentro del costo del conjunto evaluado. Excluirlos haría que la comparación describiera solo la parte exitosa del proceso.
La revisión humana merece un registro separado: tiempo empleado y criterio utilizado para valorarlo. Al incorporarla al costo operativo, conviene comprobar que no esté contada también en otro servicio. La implementación inicial puede mostrarse aparte de la operación recurrente. Esa separación permite entender qué habrá que pagar para poner en marcha la solución y qué recursos consumirá después.
Una comparación con números ficticios
Supongamos dos pruebas sobre el mismo conjunto de 1.000 solicitudes, con idéntico criterio de aceptación y alcance de costos, incluidos ejecución, reintentos y revisión. En este ejemplo hipotético, la alternativa A cuesta USD 120 y entrega 800 tareas aceptadas: USD 0,15 por tarea aceptada. La alternativa B cuesta USD 100 y entrega 500 tareas aceptadas: USD 0,20 por tarea aceptada. Son cifras inventadas para explicar el cálculo; no son tarifas, resultados de clientes ni estimaciones comerciales.
La segunda prueba tiene menor gasto total, pero deja más solicitudes sin aceptar. Por eso sugerimos presentar la razón junto con el volumen atendido, las tareas pendientes y el tiempo de respuesta. La medición debe fijar un momento de cierre y aclarar si los casos pendientes se resolvieron posteriormente. Tampoco demuestra rentabilidad: todavía falta conocer cuánto vale el resultado para esa empresa y qué exigencias debe cumplir el servicio.
Evaluar reutilización de contexto y trabajo por lotes
La guía de caché de Anthropic documenta la reutilización de segmentos idénticos de una solicitud, con precios distintos para escribir y leer la caché. También establece condiciones de coincidencia y vigencia. Para evaluar esta opción, proponemos observar cuántas lecturas reutilizan contenido y cuánto cuesta crearlo. Cambiar el contexto frecuentemente puede modificar ese balance; habilitar la función no acredita por sí solo un ahorro en el flujo completo.
El procesamiento por lotes de Anthropic ofrece una modalidad asincrónica con precios reducidos. La documentación señala que el procesamiento puede extenderse hasta 24 horas y que un lote puede expirar sin completarse en ese plazo. Conviene evaluar esta opción cuando la tarea admite espera y existe un procedimiento para tratar resultados incompletos.
En una empresa chilena, una clasificación interna que se revisará más tarde podría ser candidata a lotes; una interacción que necesita respuesta inmediata tiene otra exigencia. Es una propuesta de evaluación, no una garantía de adecuación. Antes de elegir una modalidad, hay que comprobar disponibilidad, condiciones y tarifas del proveedor contratado, además del resultado sobre tareas representativas.
Preparar un presupuesto comparable desde Chile
Sugerimos conservar los costos en la moneda en que se facturan y documentar el tipo de cambio y la fecha usados para expresarlos en pesos. Así, el equipo puede separar variaciones de consumo de cambios en la conversión. También debe distinguir tarifas públicas de condiciones contratadas y anotar el modelo, su versión y la modalidad de procesamiento que respaldan cada estimación.
Para proyectar el próximo período, proponemos escenarios de demanda con supuestos visibles: solicitudes esperadas, consumo por solicitud, frecuencia de reintentos y tiempo de revisión. El volumen de prueba puede ser insuficiente para anticipar todos los comportamientos. Registrar diferencias entre previsión y operación permite ajustar el presupuesto sin convertir un resultado inicial en una promesa.
Qué pedir al terminar el piloto
Una ficha de cierre puede reunir el alcance del costo, las solicitudes procesadas, las tareas aceptadas, los fallos, el tiempo de respuesta y el esfuerzo humano. Recomendamos comparar configuraciones sobre tareas equivalentes y conservar las condiciones de cada prueba. Si cambia el modelo o el diseño del flujo, hay que volver a comprobar la calidad antes de atribuir una mejora al menor consumo.
La decisión siguiente puede ser ampliar el uso, corregir el flujo o mantenerlo acotado. Debe apoyarse en requisitos del negocio y resultados observados. Nuestra página de cloud e infraestructura describe capacidades para sostener la operación. La guía sobre autonomía y evaluación de agentes complementa la definición de acciones y resultados que conviene comprobar.
CON TEXTO Y CONTEXTO
Fuentes y referencias
- Effect of Optimization on AI ForecastingFinOps Foundation
- PricingAnthropic — Claude Platform Docs
- Prompt cachingAnthropic — Claude Platform Docs
- Batch processingAnthropic — Claude Platform Docs
Contenido elaborado con asistencia de IA a partir de las fuentes enlazadas. Las recomendaciones corresponden al análisis editorial de Digital Dev. Cómo elaboramos y corregimos nuestros artículos.

