IA

AMD apuesta por grabar pesos de IA en silicio para superar a Nvidia en inferencia

Susan Hill

AMD está adquiriendo Taalas, una startup de Toronto que fabrica chips que incrustan los pesos de los modelos de IA de forma permanente en el silicio, en lugar de cargarlos desde la memoria durante la inferencia. Su chip HC1 genera 16.960 tokens por segundo en el modelo Llama 3.1 8B de Meta — una cifra que AMD afirma es 48 veces más rápida que las GPU de Nvidia y 8,5 veces más rápida que Cerebras, el especialista en chips de inferencia.

La tecnología de Taalas explota una ineficiencia estructural en el funcionamiento actual de la inferencia de IA. Las GPU estándar son flexibles: pueden ejecutar cualquier modelo, cambiar de tarea bajo demanda y reprogramarse cuando se actualiza un modelo. Esa flexibilidad es también el cuello de botella. Cargar miles de millones de pesos de modelo desde la memoria de alto ancho de banda a las unidades de cómputo en cada solicitud de inferencia genera una latencia que añadir más GPU no puede eliminar.

Taalas incrusta esos pesos directamente en el silicio del chip en el momento de la fabricación. El modelo reside en el hardware, no en la memoria que se consulta por solicitud. Las cifras de rendimiento que AMD está publicitando reflejan esa elección arquitectónica, pero a un precio que la empresa no minimiza: una vez que un chip se fabrica con un modelo específico integrado, actualizarlo requiere un nuevo tape-out de silicio. Taalas afirma que solo es necesario cambiar dos capas metálicas para una actualización del modelo, lo que acorta el ciclo, pero estos chips no pueden adaptarse sobre la marcha a una versión más reciente del modelo.

Según el plan de integración de AMD, los chips de Taalas gestionarán la generación de tokens —la fase más costosa en tiempo de la inferencia— mientras que las GPU Instinct de AMD se encargarán del prefill y el cálculo de atención al inicio de cada solicitud. El sistema combinado funciona sobre la plataforma rack-scale Helios de AMD. Para los operadores de nube que ejecutan cargas de trabajo con modelos fijos —bots de atención al cliente, pipelines de procesamiento de documentos, traducción en tiempo real— la promesa es un rendimiento por vatio en rack que los clústeres de GPU flexibles no pueden igualar a un coste equivalente.

Si ese cálculo sobrevive al ritmo de actualización de modelos de la industria es la cuestión central. Los principales laboratorios actualizan ahora sus modelos de producción aproximadamente cada seis meses. Un chip bloqueado en Llama 3.1 8B hoy puede tener que retirarse cuando un sucesor se convierta en el objetivo de despliegue estándar. La afirmación de Taalas sobre la actualización de dos capas metálicas ayuda, pero un tape-out de silicio sigue llevando meses completarse —un desfase significativo cuando los modelos se renuevan más rápido que los ciclos del hardware.

La adquisición llega siete meses después de que Nvidia comprara Groq —un enfoque diferente al mismo problema de velocidad de inferencia— por unos 20.000 millones de dólares, según informes. Los procesadores tensor streaming de Groq también optimizan el rendimiento pero conservan la capacidad de cargar diferentes modelos. AMD paga una cantidad no revelada, presumiblemente menor, por una startup que hizo la apuesta contraria.

Para los compradores, la adquisición de Taalas pertenece a la hoja de ruta más que al catálogo. El chip HC2, dirigido a modelos de hasta 20.000 millones de parámetros, aún está en desarrollo. El benchmark de 48x se aplica al HC1 en condiciones específicas —los despliegues reales con tráfico mixto y tamaños de lote variables producirán resultados diferentes. El cierre del acuerdo está previsto para el cuarto trimestre de 2026, pendiente de revisión regulatoria. El HC1 se envió en febrero en 6 nm; la fecha de envío del HC2 y el nodo de proceso objetivo siguen sin confirmarse.

Etiquetas: , , , ,

Debate

Hay 0 comentarios.