Ahorro mensual estimado
5765 US$
Aprobadas o aplicadas
0 US$
Hallazgos
6
Clear AI Spend no modifica tu configuración de producción. Aprobar y Marcar como aplicada solo registran tu decisión aquí; aplica el cambio en tus propios sistemas.
Switch SupportClassifier to a lower-cost model
Modelo caro para una tarea simple · SupportClassifier
Ticket routing is a short classification task running on a premium reasoning model.
Configuración actual
claude-opus-class · temperature 0.2 · full ticket body
0,040 US$ / task · tasa de éxito actual 98,7 %
Configuración recomendada
claude-haiku-class · temperature 0 · trimmed ticket body + label schema
0,0060 US$ / task · tasa de éxito estimada 98,4 %
Ahorro estimado: 1480 US$/mes
Enable prompt caching on ReplyDrafter preamble
Falta de caché · ReplyDrafter
A 6.1k-token static preamble is re-billed on every one of ~41k monthly calls.
Configuración actual
No prompt caching · full preamble per call
0,052 US$ / task · tasa de éxito actual 97,2 %
Configuración recomendada
Provider prompt caching enabled · 5 min TTL
0,031 US$ / task · tasa de éxito estimada 97,2 %
Ahorro estimado: 1240 US$/mes
Add structured output + retry ceiling on LeadEnricher
Reintentos excesivos · LeadEnricher
Schema validation failures trigger up to 4 retries on a premium model.
Configuración actual
Free-form JSON parsing · max 4 retries · same model on retry
0,118 US$ / task · tasa de éxito actual 91,3 %
Configuración recomendada
Native structured outputs · max 1 retry · efficient model on retry
0,061 US$ / task · tasa de éxito estimada 94,4 %
Ahorro estimado: 1105 US$/mes
Replace full-log context with top-k retrieval
Contexto sobredimensionado · IncidentSummarizer
Average 11.2k input tokens per summary where 1.6k retrieved chunks match quality.
Configuración actual
Entire incident log inlined
0,074 US$ / task · tasa de éxito actual 95,8 %
Configuración recomendada
Vector retrieval, top 8 chunks, 1.6k token budget
0,027 US$ / task · tasa de éxito estimada 95,1 %
Ahorro estimado: 840 US$/mes
Add a loop breaker to PipelineTriager
Bucles de llamadas a herramientas · PipelineTriager
12% of runs exceed 8 tool calls without converging, then fail.
Configuración actual
Unbounded tool loop · premium model each hop
0,163 US$ / task · tasa de éxito actual 88,1 %
Configuración recomendada
Max 4 tool hops · escalate to human after budget breach
0,098 US$ / task · tasa de éxito estimada 89,7 %
Ahorro estimado: 690 US$/mes
Fingerprint-dedupe SQLCopilot requests
Solicitudes duplicadas · SQLCopilot
Identical query requests within 60s are billed twice.
Configuración actual
No deduplication layer
0,021 US$ / task · tasa de éxito actual 96,5 %
Configuración recomendada
Request fingerprint cache · 120s window
0,017 US$ / task · tasa de éxito estimada 96,5 %
Ahorro estimado: 410 US$/mes