La nueva escasez de CPUs: un desafío silente en la era de la inteligencia artificial

Por
7 min de lectura

Recientemente, en una cena informal con varios CTOs y responsables de infraestructura, salió a la luz una problemática que está pasando desapercibida para muchos: la dificultad para obtener CPUs en el entorno actual, un problema que está tomando mayor protagonismo tras la etapa de generosos descuentos ofrecidos por los proveedores de servicios en la nube.

Históricamente, los usuarios podían aprovechar las instancias spot, que ofrecían CPUs a precios hasta un 90% inferiores al estándar, gracias a máquinas menos utilizadas que los proveedores ponían a disposición temporalmente. Sin embargo, con el auge de la inteligencia artificial (IA) y la demanda desmesurada que esta genera, estos escenarios fantásticos han desaparecido, eliminando casi por completo la disponibilidad de CPUs a bajo coste y forzando a las empresas a planificar la compra de capacidad con meses de antelación.

Incluso los gigantes tecnológicos frente a la falta de CPUs

Para entender mejor esta situación, hablamos con Simon Eskildsen, CEO de turbopuffer, una plataforma que opera principalmente con CPUs en nubes como AWS, Google Cloud y Azure. Simon destacó que hoy obtener CPUs no es sencillo, especialmente debido al crecimiento de cargas de trabajo relacionadas con el Aprendizaje por Refuerzo (RL, por sus siglas en inglés), que requiere una gran cantidad de CPUs para entrenar modelos y ejecutar software asociado.

“La demanda se ha desplazado hacia agentes de propósito general, lo que incrementa considerablemente la necesidad de CPUs. Incluso las grandes empresas compiten intensamente por las asignaciones disponibles. Creo que esta situación empeorará antes de mejorar.”

Este testimonio fue refrendado por un vicepresidente de ingeniería de un proveedor importante de servicios de inferencia, quien reveló que están al límite de su capacidad de compra tanto en GPUs como en CPUs, pese a contar con presupuesto y disposición para contratos a largo plazo. Los proveedores simplemente no tienen más capacidad disponible.

Inteligencia artificial: la gran devoradora de CPUs

Katelyn Lesse, responsable de ingeniería de plataformas de Claude Platform, ha explicado cómo el vertiginoso crecimiento de la IA está tensando la cadena de suministro de hardware hasta sus límites, con cuellos de botella tanto en la fabricación como en la competencia por materiales esenciales.

“La demanda impulsada por la IA requiere invertir años y miles de millones para ampliar la capacidad, pero los procesos de producción están saturados. TSMC tiene que repartir sus líneas de ensamblaje entre GPUs y CPUs; los fabricantes de memoria están priorizando HBM (memoria de alto ancho de banda), que es más rentable que la DRAM tradicional, lo que encarece la memoria necesaria para las CPUs.”

Esta presión en la cadena de suministro se traduce en aumentos de precios y tiempos de entrega más largos. Por ejemplo, los pedidos de servidores que antes se cumplían en semanas hoy tardan seis meses o más, y los precios han subido entre un 10 y un 20%.

El crecimiento exponencial de las cargas de trabajo basadas en agentes

El impacto de la IA en la demanda de CPUs se refleja también en un notable aumento de las peticiones a agentes de software que no solo afectan a GPUs para inferencias, sino que requieren también una considerable capacidad de CPU para compilar código, ejecutar pruebas o aplicar linters. Empresas como Uber han visto cómo estas peticiones aumentaron nueve veces en tan solo seis meses.

Crecimiento en las peticiones de agentes AI en seis meses
Incremento de nueve veces en peticiones de agentes en medio año. Fuente: Uber

Estos agentes han dejado de ejecutarse en los ordenadores locales de los desarrolladores para funcionar en instancias dedicadas en la nube, lo que eleva la demanda agregada de CPUs en infraestructuras remotas.

Planificación anticipada y eficiencia: claves para afrontar la crisis

La recomendación para las empresas es empezar a planificar la adquisición de CPUs con hasta 12 meses de antelación para garantizar la capacidad necesaria. La tradicional flexibilidad para escalar o utilizar instancias spot se está volviendo impracticable en este nuevo escenario.

Además, optimizar el uso de los recursos ya disponibles es imprescindible. Esto implica identificar qué servicios consumen mayor cantidad de CPU y analizar si su uso es imprescindible o se puede redistribuir la carga a nodos menos activos para liberar capacidad para las áreas críticas.

Un fenómeno generalizado que afecta a toda la industria tecnológica

Esta escasez de CPUs no es un caso aislado. Va en paralelo a los problemas ya conocidos de falta de GPUs, memoria RAM y discos duros. La convergencia de todos estos cuellos de botella es consecuencia directa de la adopción masiva de tecnologías basadas en IA, que demandan hardware de alto rendimiento en volúmenes inéditos.

Regiones completas en la nube empiezan a no aceptar nuevos clientes porque su capacidad de CPU está completamente arrendada, y algunas compañías ya pagan por reservar instancias que no estarán disponibles hasta dentro de meses. Este modelo, aunque criticado, representa el nuevo statu quo en un mercado donde la demanda supera ampliamente a la oferta.

En definitiva, la era de la inteligencia artificial está redefiniendo el mercado de hardware, imponiendo a ingenieros y directivos un nuevo paradigma en la gestión y planificación de capacidades de cómputo, donde la anticipación y la eficiencia serán factores decisivos para sobrevivir y crecer en la nube.

Compartir este artículo
No hay comentarios

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *