Recomendaciones

Cambios de configuración con ahorro previsto, impacto en calidad y riesgo

Datos de demostración. Todavía no hay ningún proveedor de IA ni gateway conectado: todas las cifras de esta pantalla son datos de ejemplo, no telemetría real.

Ahorro mensual estimado

5765 US$

Estimación, no ahorro medido

Aprobadas o aplicadas

0 US$

0 / 6

Hallazgos

6

Clear AI Spend no modifica tu configuración de producción. Aprobar y Marcar como aplicada solo registran tu decisión aquí; aplica el cambio en tus propios sistemas.

Switch SupportClassifier to a lower-cost model

Modelo caro para una tarea simple · SupportClassifier

Confianza 94 %
Riesgo: BajoPropuesta

Ticket routing is a short classification task running on a premium reasoning model.

Configuración actual

claude-opus-class · temperature 0.2 · full ticket body

0,040 US$ / task · tasa de éxito actual 98,7 %

Configuración recomendada

claude-haiku-class · temperature 0 · trimmed ticket body + label schema

0,0060 US$ / task · tasa de éxito estimada 98,4 %

Ahorro estimado: 1480 US$/mes

Enable prompt caching on ReplyDrafter preamble

Falta de caché · ReplyDrafter

Confianza 97 %
Riesgo: BajoPropuesta

A 6.1k-token static preamble is re-billed on every one of ~41k monthly calls.

Configuración actual

No prompt caching · full preamble per call

0,052 US$ / task · tasa de éxito actual 97,2 %

Configuración recomendada

Provider prompt caching enabled · 5 min TTL

0,031 US$ / task · tasa de éxito estimada 97,2 %

Ahorro estimado: 1240 US$/mes

Add structured output + retry ceiling on LeadEnricher

Reintentos excesivos · LeadEnricher

Confianza 89 %
Riesgo: BajoPropuesta

Schema validation failures trigger up to 4 retries on a premium model.

Configuración actual

Free-form JSON parsing · max 4 retries · same model on retry

0,118 US$ / task · tasa de éxito actual 91,3 %

Configuración recomendada

Native structured outputs · max 1 retry · efficient model on retry

0,061 US$ / task · tasa de éxito estimada 94,4 %

Ahorro estimado: 1105 US$/mes

Replace full-log context with top-k retrieval

Contexto sobredimensionado · IncidentSummarizer

Confianza 82 %
Riesgo: MedioPropuesta

Average 11.2k input tokens per summary where 1.6k retrieved chunks match quality.

Configuración actual

Entire incident log inlined

0,074 US$ / task · tasa de éxito actual 95,8 %

Configuración recomendada

Vector retrieval, top 8 chunks, 1.6k token budget

0,027 US$ / task · tasa de éxito estimada 95,1 %

Ahorro estimado: 840 US$/mes

Add a loop breaker to PipelineTriager

Bucles de llamadas a herramientas · PipelineTriager

Confianza 78 %
Riesgo: MedioPropuesta

12% of runs exceed 8 tool calls without converging, then fail.

Configuración actual

Unbounded tool loop · premium model each hop

0,163 US$ / task · tasa de éxito actual 88,1 %

Configuración recomendada

Max 4 tool hops · escalate to human after budget breach

0,098 US$ / task · tasa de éxito estimada 89,7 %

Ahorro estimado: 690 US$/mes

Fingerprint-dedupe SQLCopilot requests

Solicitudes duplicadas · SQLCopilot

Confianza 93 %
Riesgo: BajoPropuesta

Identical query requests within 60s are billed twice.

Configuración actual

No deduplication layer

0,021 US$ / task · tasa de éxito actual 96,5 %

Configuración recomendada

Request fingerprint cache · 120s window

0,017 US$ / task · tasa de éxito estimada 96,5 %

Ahorro estimado: 410 US$/mes