A lo largo de los últimos meses, varias compañías tecnológicas de primer nivel han implementado estrategias para reducir sus costes asociados al uso de inteligencia artificial (IA), particularmente en sus departamentos de ingeniería. Este movimiento responde a un contexto donde el gasto en IA se ha disparado, haciendo insostenible la utilización exclusiva de modelos cerrados de alto coste.
En mayo se reportó una tendencia emergente de empresas que buscaban contener sus gastos en IA, recurriendo a diferentes tácticas. Entre las más comunes se encuentran la experimentación con modelos de código abierto ejecutados a través de proveedores de inferencia más económicos, la inversión en sistemas inteligentes de enrutamiento que asignan las tareas más simples a modelos menos costosos, la implementación de límites mensuales por desarrollador y la formación para utilizar dichos recursos de forma más eficiente.
Uber reduce sus costes de IA a la mitad gracias a modelos abiertos y optimizaciones
Uber protagoniza un caso de éxito en esta dirección. A principios de año, la empresa había consumido en apenas tres meses todo su presupuesto anual destinado a IA. Su COO reconoció la dificultad de justificar el gasto en herramientas de alto coste sin obtener beneficios proporcionales. La respuesta llegó desde el equipo de ingeniería, que aplicó un conjunto de optimizaciones que permitieron reducir el coste por petición de IA un 34% y el coste por sesión un 52%, manteniendo la calidad del código generado.
Uber implementó las siguientes medidas:
- Uso de modelos de peso abierto ejecutados en servicios de inferencia mucho más asequibles que los modelos de última generación.
- Benchmarking constante, con pruebas semanales basadas en escenarios reales para evaluar la capacidad y coste de distintos modelos.
- Empleo de submodelos más económicos para tareas pequeñas que no necesitaban el modelo más potente.
- Ajuste del esfuerzo de los modelos de última generación para mejorar la relación coste-beneficio, optando por un esfuerzo medio.
- Optimización automática de solicitudes largas, compactando los textos cuando superaban los 400.000 tokens, incluso con modelos que soportan hasta 1 millón de tokens.
- Caching de prompts con el propio sistema interno Minions, para evitar costes innecesarios.
El cambio más trascendental fue la transición al uso de modelos abiertos para ciertas tareas, que pueden ser hasta 20 veces más baratos que los modelos cerrados de vanguardia. Este salto ha permitido a Uber mantener sus costes estables desde marzo, a pesar del creciente uso de tokens y sesiones.
Pinterest reduce sus costes en un 90% con modelos abiertos entrenados internamente
En una llamada con inversores, el CEO de Pinterest, William Ready, explicó la estrategia de la plataforma social para maximizar la eficiencia en IA. Según Ready, Pinterest utiliza modelos específicos adaptados para sus propios casos, así como modelos abiertos que han sido postentrenados en su entorno y datos únicos. Este proceso ha permitido lograr costes por transacción inferiores al 8% respecto a modelos cerrados comparables, facilitando una expansión económica y efectiva de sus capacidades IA.
En términos prácticos, un proceso que antaño costaba 100 dólares en modelos cerrados, ahora le sale a Pinterest por 8 dólares mediante modelos abiertos ejecutados en infraestructuras propias o alquiladas.
AT&T baja su gasto en IA un 56% utilizando modelos abiertos sin perder calidad significativa
AT&T, empresa que emplea a 100.000 personas y que realiza un considerable gasto en IA, ha conseguido reducir su factura en un 56% al migrar cargas de trabajo a modelos abiertos. Según un ejecutivo de la empresa, la calidad del resultado solo ha disminuido un 2%. Los desarrolladores todavía recurren a modelos de última generación para tareas complejas como la generación de código, mientras que para trabajos más simples, por ejemplo resúmenes de código previo, se utilizan modelos abiertos mucho más económicos.
Parte de esta optimización ha sido posible gracias al uso de LiteLLM, un router de modelos que gestiona eficientemente las solicitudes según su complejidad y coste.
Anthropic, modelo caro en un mercado con alternativas más baratas
Hace pocos meses, el modelo Claude de Anthropic y su entorno de desarrollo Claude Code eran los preferidos en la industria. Sin embargo, su precio ha crecido considerablemente en contraste con el abaratamiento de otros modelos abiertos o incluso de OpenAI. Actualmente, modelos como Opus 5 resultan hasta 100 veces más caros que opciones como GPT-5.6 Luna xhigh o DeepSeek, lo que ha impulsado a las empresas a buscar alternativas más económicas con prestaciones similares.
Lecciones de Stripe, Coinbase, Uber y Ramp para gestionar costes en IA
Un análisis realizado por el equipo de ingeniería de Databricks, que entrevistó a profesionales de empresas como Stripe, Coinbase, Uber y Ramp, identifica claves para reducir gastos en IA:
- Adopción de modelos abiertos para lograr ahorros significativos.
- Enrutamiento inteligente de modelos para asignar tareas según su complejidad y costo.
- Controles de gasto y optimización de contexto para moderar el consumo, aunque con menor impacto comparativo que las dos anteriores.
Recientemente, Ramp confirmó que en agosto las empresas líderes redujeron su gasto en IA en un 10%, probablemente más por optimización del coste que por reducción del uso.
Este cambio de paradigma, de modelos cerrados y costosos a abiertos y más asequibles, apunta a una nueva etapa en la aplicación de la inteligencia artificial en ingeniería, donde la sostenibilidad económica es tan importante como la innovación técnica.