IA

El chip Jalapeño de OpenAI procesa inferencias con una eficiencia 1,9 veces superior a Nvidia Blackwell por vatio

Adrian Kessler

OpenAI ha fabricado su propio chip. La compañía presentó Jalapeño en la conferencia Hot Chips el 25 de agosto, un diseño de silicio desarrollado en colaboración con Broadcom que procesa solicitudes de inferencia a 85.448 tokens por segundo por kilovatio. La arquitectura Blackwell de Nvidia, el estándar actual del mercado, alcanza 44.960 en la misma métrica. La relación es de 1,9 veces.

La métrica importa porque la inferencia es la forma en que los sistemas de IA funcionan en producción. El entrenamiento ocurre una vez; la inferencia ocurre cada vez que alguien envía una consulta a ChatGPT, utiliza una API o interactúa con cualquier aplicación que ejecute un modelo de lenguaje. El coste de la inferencia a escala es el principal motor de la economía de los servicios de IA. Un chip que reduce el consumo energético de la inferencia aproximadamente a la mitad, si se despliega ampliamente, cambia el coste por consulta de ejecutar modelos.

En cargas de trabajo interactivas, donde la latencia de respuesta es el factor limitante, la ventaja de Jalapeño se extiende aún más. El informe de SemiAnalysis sobre la presentación en Hot Chips situó el rango entre 2,1 y 4,1 veces mejor que Blackwell en esos puntos de referencia. La dispersión refleja la variación entre tipos de tareas específicas; el límite inferior es la comparación más conservadora.

El chip solo maneja inferencia. No ejecuta las cargas de trabajo de entrenamiento que produjeron los modelos que Jalapeño está diseñado para ejecutar. Esas aún requieren hardware de Nvidia. Broadcom fabricó el chip bajo un acuerdo de diseño personalizado con OpenAI, en lugar de venderlo como producto comercial. El acuerdo le da a OpenAI una capa de inferencia hecha a medida sin necesidad de competir en el mercado de chips comerciales.

El cronograma de despliegue de OpenAI es limitado. Se prevé un lanzamiento a pequeña escala antes de finales de 2026; un despliegue más amplio es un objetivo para 2027. El chip permanece en la fase de muestras de ingeniería, lo que significa que la versión de producción aún no se ha enviado a escala. Los puntos de referencia en Hot Chips representan el objetivo de diseño, no una ejecución de producción verificada. La brecha entre el anuncio en una conferencia y el despliegue operativo de un silicio personalizado suele medirse en años.

El anuncio encaja en un cambio más amplio entre las grandes empresas de IA hacia el silicio personalizado. Google ha operado sus propias Unidades de Procesamiento Tensorial en producción durante una década. Amazon ejecuta Trainium e Inferentia en AWS. Meta opera sus propios chips de inferencia internamente. La entrada de OpenAI confirma que, a la escala de cientos de millones de usuarios activos, la economía de depender enteramente de proveedores externos de GPU se vuelve lo suficientemente difícil como para justificar el coste de un programa de diseño personalizado.

Etiquetas: , , , , ,

Debate

Hay 0 comentarios.