Trainium4 y NVLink Fusion: la alianza de AWS y NVIDIA que redefine la IA en la nube llegará para acelerar todavía más el diseño a hiperescala

Matias 6 Comments 2025-12-03 10:43:05

Amazon Web Services y NVIDIA han confirmado una colaboración estratégica para la próxima generación de chips de entrenamiento de IA, el Trainium4. La clave reside en la integración del interconector de alta velocidad NVLink Fusion de NVIDIA con la arquitectura de AWS, lo que permitirá construir superordenadores de IA a escala de rack con un rendimiento sin precedentes. Esta alianza, anunciada en re:Invent 2025, busca unificar el silicio personalizado de AWS con su nuevo Trainium4, con el ecosistema de red líder de la industria como es NVLink, reduciendo con ello drásticamente los plazos de innovación.

La demanda de grandes modelos de lenguaje y arquitecturas MoE (Mixture of Experts) exige que los centros de datos operen con la máxima eficiencia en la transferencia de datos, no solo en el cálculo puro, y ahí NVIDIA es la reina de la fiesta. Los desafíos de construir estas infraestructuras a medida son inmensos en coste y complejidad. Por lo tanto, ¿cómo logra exactamente la combinación del silicio de AWS con la tecnología de NVIDIA resolver el cuello de botella que supone mover ingentes cantidades de datos entre 72 o más GPU con sus aceleradores anexos?

NVIDIA y AWS se unen para cohesionar el futuro Trainium4 con NVLink Fusion

NVIDIA NVLink Fusion para AWS Trainium4

El corazón del avance que hemos presenciado es la plataforma NVLink Fusion, que no es simplemente un cable de alta velocidad, sino una solución de infraestructura completa a escala de rack. Esta plataforma se distingue por el uso del chiplet NVLink Fusion, un componente que permite a AWS (o a cualquier diseñador de ASIC personalizados, es indiferente) conectar directamente su silicio al interconector y al Switch NVLink.

Las especificaciones de rendimiento que aporta esta tecnología son rigurosas y bastante espectaculares. Hablamos de la integración de la sexta generación de NVLink (NVLink 6) mediante la Vera-Rubin NVLink Switch, que incorpora SerDes personalizados de 400G. Esta configuración permite alcanzar una interconexión all-to-all entre hasta 72 ASICs dentro de un único dominio scale-up.

La velocidad resultante de esta barbaridad es de 3,6 TB/s por ASIC, lo que culmina en un ancho de banda total de 260 TB/s para el rack, datos de locura, demenciales. Este nivel de rendimiento es lo que realmente separa a la IA industrial de la experimental.

Pero no queda todo ahí en simple velocidad y nada más, porque AWS y NVIDIA han ido más allá. El Switch NVLink soporta funcionalidades avanzadas, como el acceso a memoria peer-to-peer y el protocolo SHARP (Scalable Hierarchical Aggregation and Reduction Protocol) para realizar reducciones y multicasts dentro de la red, reduciendo la latencia en la agregación de gradientes. Y claro, explicada la plataforma NVLink Fusion, ¿qué aporta Amazon a esta unión con NVIDIA? El futuro Trainium4.

Amazon se saca de la manga su nuevo Trainium4 nada más presentar la versión Trainium3

AWS Trainium4

En el lado de AWS, y viendo que hace horas ha presentado su EC2 Trn3 UltraServers, el chip Trainium4 se perfila como la pieza clave del procesamiento, aunque fue presentado como un adelanto que aún está en desarrollo. Las características técnicas que se han confirmado son más bien estratégicas que de silicio.

Amazon ha asegurado que ofrecerá un salto significativo en el rendimiento de entrenamiento respecto a la generación anterior, el recién llegado Trainium3. Este último, por su parte y como ya sabemos, se lanzó con arquitectura de 3 nanómetros (N3), ofreciendo más de cuatro veces la velocidad y cuatro veces la memoria de su predecesor, el Trainium2.

La principal característica técnica del Trainium4 es, sin embargo, su diseño para soportar nativamente NVLink Fusion, una maniobra clave para asegurar la compatibilidad con el ecosistema CUDA y simplificar la migración de modelos.

La interpretación de esta sinergia es bastante obvia y por lo que se han unido NVIDIA y Amazon: AWS no solo obtiene un interconector scale-up de alto rendimiento, sino que también aprovecha el ecosistema modular de NVIDIA, basado en la arquitectura de rack OCP MGX. Esto permite a AWS construir racks que pueden alojar silicio heterogéneo (Trainium4, CPU Graviton e incluso futuras GPU de NVIDIA) con un diseño de refrigeración y energía validado. En cambio, diseñar esta compleja infraestructura desde cero suele llevar años y miles de millones de inversión, lo que subraya la eficiencia de la decisión de AWS.

La IA será el mayor detonante de servicios de la historia, se pagará menos, pero por más cosas

AWS y NVIDIA presentan NVLink Fusion y Trainium4

Este movimiento podría obligar a otros hiperescaladores a repensar su estrategia de desarrollo de hardware, buscando atajos similares o alternativas igualmente robustas. Al final, lo que se buscan son dos cosas: reducción de tiempo y reducción de costes. Unir fuerzas es ahora mismo clave para diferenciarse del resto de competidores y acelerar el paso a base de velocidad y potencia, para así desarrollar mejores IA que repercutan en ingresos futuros de manera más veloz.

Y es que ese es el principal problema de la IA: el retorno de la inversión a largo plazo. Tienen que acortarlo, y para ello, necesitan generar LLM más potentes con mayores aplicaciones a nivel general que el usuario quiera pagar por dichos servicios. Como llevamos años diciendo, estamos en la época de pagar por un servicio sin ser el dueño. Al final, no tendrás nada (de valor) y serás feliz (con los servicios por los que pagas).

boton whatsapp sharkinformatica
boton whatsapp sharkinformatica