NVIDIA ha movido ficha y ha presentado oficialmente su arquitectura de GPU Blackwell Ultra como el núcleo de una nueva era de cómputo para Inteligencia Artificial. Y no solamente eso, puesto que el diseño combina integración avanzada de silicio con un ecosistema de software a la altura de las exigencias actuales esperadas por sus socios. Esta GPU se ha concebido para alimentar centros de datos de gran escala (denominados por la propia compañía como FAB de IA) y ofrece un salto cualitativo en rendimiento, eficiencia energética y escalabilidad, introduciendo entre otras cosas el formato de precisión NVFP4, el diseño de doble retícula y la interfaz NV-HBI. Veamos qué tan impactante es esta Blackwell Ultra.
Mayor ancho de banda, HBM3E, Tensor Core de quinta generación, el nuevo formato de precisión NVFP4 y el comentado diseño de doble retícula son las novedades de NVIDIA para esta arquitectura y GPU, que lógicamente, se basa en las actuales Blackwell para llegar al mercado en lo que podríamos entender como un avance mayor del que veremos entre las RTX 50 y RTX 50 SUPER en unos meses.
En esencia, y para simplificar el concepto en nuestra cabeza, Blackwell Ultra no es una GPU monolítica tradicional, sino una composición de dos retículas unidas mediante la nueva interfaz de alto rendimiento conocida como NV-HBI (NVIDIA High Bandwidth Interface), que alcanza un ancho de banda interno de 10 terabytes por segundo. Aunque físicamente se trata de dos die de silicio, se comporta como un único acelerador CUDA totalmente integrado. Está fabricado en un proceso avanzado de TSMC, el 4NP que ya vimos, y reúne la impresionante cifra de 208.000 millones de transistores (más del doble de lo que integraba Hopper en su momento, concretamente, 2,6 veces).
La GPU se compone de 4 GPC por cada die, donde cada uno tiene su propio controlador de memoria HBM3E con hasta 288 GB de capacidad a modo de 8 stacks, los cuales consiguen una velocidad de 8 TB/s. La L2 se divide por cada 2 GPC, siendo esta compartida, mientras que el GEMC (GIGATHREAD ENGINE WITH MIG CONTROL) hace de interconexión con el resto de elementos simétricos al otro lado del die.
Sobra decir que el NVLink de quinta generación con 1.800 GB/s solo está a un lado de la GPU en conjunto, mientras que al lado contrario tenemos el NVLink-C2C con la mitad de ancho de banda que conecta la memoria coherente entre CPU y GPU. Por último, y no menos importante, solo habrá un controlador PCIe 6.0 con 256 GB/s, pero, ¿dónde queda entonces el NV-HBI? Pues en el centro de ambos dies, además, es doble, uno para cada uno. Este conecta todos los elementos descritos y permite el paso de la información entre toda la GPU, de ahí su importancia al tener este diseño de doble retícula, el cual se expandirá con Vera Rubin y sucesivas arquitecturas.
Lo de los GPC de NVIDIA es una locura. Como hemos comentado, tenemos 4 por cada die, 8 en total, donde cada uno alberga 20 SM, lo que hace que la GPU al completo Blackwell Ultra tenga 160 en total, 80 por cada die. Adentrándonos en un GPC y luego en un SM podemos ver los cambios que implementa NVIDIA con su característico diagrama.
Cada SM contiene 128 Shaders, o CUDA Cores, los cuales trabajan como ya sabemos con FP32 e INT32 además de otros formatos y precisiones. Lo interesante aquí es que cada uno de estos SM alberga 4 Tensor Cores de 5 Gen, los cuales contienen la segunda generación de Transformer Engine, siendo estos optimizados para FP8, FP6 y NVFP4.
Además, cada SM tiene 256 KB de Tensor Memory (TMEM), repartidos en 64 KB por cada Tensor Core como motor independiente. Según NVIDIA, esto se ha dispuesto así para reducir el tráfico de la memoria hacia fuera de la GPU. Evidentemente, esta nueva unidad como tal implica que las SFU ahora hayan evolucionado, según los verdes, para una mejor matemática "trascendentales" y operaciones especiales que usan los núcleos en IA, aunque no dan más detalles.
Lo único que comentan anexo a esto es que sus SFU ahora son dos veces más rápidas que en comparación con Blackwell, y eso es realmente muy impresionante dentro de lo que se denomina como Attention Mechanism.
La memoria es uno de sus pilares fundamentales. Integra módulos HBM3E de alta capacidad (288 GB, nada menos que 3,6 veces la cantidad del H100), lo que permite afrontar entrenamientos de modelos de gran tamaño y razonamiento a tiempo real sin que el sistema se vea limitado por el acceso a datos. De este modo, Blackwell Ultra puede sostener cargas de trabajo donde la cantidad de contexto y el volumen de parámetros crecen de manera exponencial.
Esto se consigue también gracias a los 16 controladores de memoria con 512 bits cada uno (8.192 bits en total), lo que sumado a los 8 TB/s de cada stack deja un ancho de banda increíble de 3,35 TB/s en memoria. Los Tensor Cores de quinta generación son otra de las piezas clave. Mejoran el tratamiento de las capas de atención (con hasta el doble de velocidad respecto a la generación previa) y ofrecen un soporte más eficiente para cálculos en precisión mixta.
| Interconexión | Hopper GPU | Blackwell GPU | Blackwell Ultra GPU |
|---|---|---|---|
| NVLink (GPU-GPU) | 900 GB/s | 1,800 GB/s | 1,800 GB/s |
| NVLink-C2C (CPU-GPU) | 900 GB/s | 900 GB/s | 900 GB/s |
| Interfaz PCIe | 128 GB/s (Gen 5) | 256 GB/s (Gen 6) | 256 GB/s (Gen 6) |
Estas cifras sitúan a Blackwell Ultra en un nivel 1,5 veces superior al Blackwell estándar y 7,5 veces por encima de Hopper (representado por GPU como H100 o H200), lo cual, es casi ciencia ficción para el corto periodo de tiempo que ha pasado entre la arquitectura original y esta versión Ultra como mejora.
El apartado de conectividad está igualmente reforzado. Blackwell Ultra se ha concebido para desplegarse en configuraciones masivas, con racks completos de GPU trabajando de manera coordinada. La arquitectura incluye compatibilidad con sistemas como GB300 NVL72 y con InfiniBand a 800 gigabits por segundo, todo ello soportado por NVLink de quinta generación, lo que permite escalar hasta cientos de GPUs en un mismo clúster sin que se pierda cohesión operativa.
El propósito de este despliegue tecnológico es claro: proporcionar la base de hardware para el concepto de FAB de IA, infraestructuras capaces de generar tokens a gran velocidad y a un coste mucho menor.
Esto permite habilitar modelos de razonamiento avanzado, agentes inteligentes y servicios de inferencia en tiempo real, con una eficiencia sin precedentes. En definitiva, lo que buscan los centros de datos y las empresas que están pujando por dominar el sector desde el software.
De hecho, la topología máxima que puede alcanzar Blackwell Ultra es de nada menos que 576 GPU en configuración de NVL72 con 72 GPU, lo que significa un ancho de banda agregado de 130 TB/s, cifras de locura.
La propuesta de NVIDIA no se limita al hardware, ya que el software es, quizás, lo mejor que tiene NVIDIA realmente. Acompañando a Blackwell Ultra se encuentra Dynamo, un Sistema Operativo orientado a la inferencia en entornos multi-GPU.
Esta plataforma coordina el reparto de tareas (por ejemplo, asignando GPU específicas al prefill o a la generación de tokens), optimiza la comunicación entre nodos con mejoras en NCCL que, según dice NVIDIA, reducen la latencia hasta cuatro veces, aprovecha InfiniBand para descargar operaciones directamente en la GPU y permite almacenar en disco la caché de atención para consultas repetidas.
Todo ello bajo un modelo de software abierto que facilita la adopción tanto por parte de grandes proveedores de servicios en la nube como de empresas más pequeñas. En conjunto, y para que se entienda, Blackwell Ultra y Dynamo representan la visión de NVIDIA de una infraestructura integral para la Inteligencia Artificial. Es decir, hardware y software haciendo uno en tándem perfecto para maximizar el rendimiento siendo específicos para la plataforma en concreto.
| Característica | Hooper | Blackwell | Blackwell Ultra |
|---|---|---|---|
| Proceso de fabricación | TSMC 4N | TSMC 4NP | TSMC 4NP |
| Transistores | 80 Billones | 208 Billones | 208 Billones |
| Dies por GPU | 1 | 2 | 2 |
| Rendimiento NVFP4 dense y sparse | – | 10 | 20 petaFLOPS | 15 | 20 petaFLOPS |
| Rendimiento FP8 dense y sparse | 2 | 4 petaFLOPS | 5 | 10 petaFLOPS | 5 | 10 petaFLOPS |
| Attention acceleration (SFU EX2) |
4,5 TeraExponentials/s | 5 TeraExponentials/s | 10,7 TeraExponentials/s |
| Capacidad máxima de HBM | 80 GB HBM (H100) 141 GB HBM3E (H200) |
192 GB HBM3E | 288 GB HBM3E |
| Ancho de banda máximo de HBM | 3,35 TB/s (H100) 4,8 TB/s (H200) |
8 TB/s | 8 TB/s |
| Ancho de banda de NVLink | 900 GB/s | 1.800 GB/s | 1.800 GB/s |
| Potencia máxima (TGP) | Hasta 700W | Hasta 1.200 W | Hasta 1.400 W |
Sea como fuere, Blackwell Ultra a tirado la puerta abajo y las empresas llevan haciendo cola meses, ahora entendemos mucho mejor los motivos. Y hasta aquí esta nueva GPU para IA, la cual, va a romper con todo lo establecido meses después de la llegada de su primera y más primitiva arquitectura.
Para poder comprar, aprovechar las promociones y utilizar los medios de pago en nuestro sitio es requisitio estar correctamente registrado. En ningún momento recibirá correo electrónico que no haya solicitado. Pero se le pediran una serie de datos personales indispensables para cualquier operación comercial.
Los datos solicitados son necesarios para confeccionar la factura de los productos comprados y la dirección física para el envio de su compra.
Para más informació sobre nuestras políticas en el tratamiento de los datos personales visite la sección Terminos y Condiciones.
