NVIDIA Blackwell Ultra es oficial: la primera GPU con diseño de doble retícula, NV-HBI, y 208 mil millones de transistores para dominar la IA

Matias 6 Comments 2025-08-25 10:43:05

NVIDIA ha movido ficha y ha presentado oficialmente su arquitectura de GPU Blackwell Ultra como el núcleo de una nueva era de cómputo para Inteligencia Artificial. Y no solamente eso, puesto que el diseño combina integración avanzada de silicio con un ecosistema de software a la altura de las exigencias actuales esperadas por sus socios. Esta GPU se ha concebido para alimentar centros de datos de gran escala (denominados por la propia compañía como FAB de IA) y ofrece un salto cualitativo en rendimiento, eficiencia energética y escalabilidad, introduciendo entre otras cosas el formato de precisión NVFP4, el diseño de doble retícula y la interfaz NV-HBI. Veamos qué tan impactante es esta Blackwell Ultra.

Mayor ancho de banda, HBM3E, Tensor Core de quinta generación, el nuevo formato de precisión NVFP4 y el comentado diseño de doble retícula son las novedades de NVIDIA para esta arquitectura y GPU, que lógicamente, se basa en las actuales Blackwell para llegar al mercado en lo que podríamos entender como un avance mayor del que veremos entre las RTX 50 y RTX 50 SUPER en unos meses.

NVIDIA Blackwell Ultra: la cuadratura de la arquitectura para dominar el mercado de la IA con firmeza

NVIDIA-Blackwell-Ultra-GPU-diagrama

En esencia, y para simplificar el concepto en nuestra cabeza, Blackwell Ultra no es una GPU monolítica tradicional, sino una composición de dos retículas unidas mediante la nueva interfaz de alto rendimiento conocida como NV-HBI (NVIDIA High Bandwidth Interface), que alcanza un ancho de banda interno de 10 terabytes por segundo. Aunque físicamente se trata de dos die de silicio, se comporta como un único acelerador CUDA totalmente integrado. Está fabricado en un proceso avanzado de TSMC, el 4NP que ya vimos, y reúne la impresionante cifra de 208.000 millones de transistores (más del doble de lo que integraba Hopper en su momento, concretamente, 2,6 veces).

La GPU se compone de 4 GPC por cada die, donde cada uno tiene su propio controlador de memoria HBM3E con hasta 288 GB de capacidad a modo de 8 stacks, los cuales consiguen una velocidad de 8 TB/s. La L2 se divide por cada 2 GPC, siendo esta compartida, mientras que el GEMC (GIGATHREAD ENGINE WITH MIG CONTROL) hace de interconexión con el resto de elementos simétricos al otro lado del die.

Sobra decir que el NVLink de quinta generación con 1.800 GB/s solo está a un lado de la GPU en conjunto, mientras que al lado contrario tenemos el NVLink-C2C con la mitad de ancho de banda que conecta la memoria coherente entre CPU y GPU. Por último, y no menos importante, solo habrá un controlador PCIe 6.0 con 256 GB/s, pero, ¿dónde queda entonces el NV-HBI? Pues en el centro de ambos dies, además, es doble, uno para cada uno. Este conecta todos los elementos descritos y permite el paso de la información entre toda la GPU, de ahí su importancia al tener este diseño de doble retícula, el cual se expandirá con Vera Rubin y sucesivas arquitecturas.

La potencia de los GPC en Blackwell Ultra es increíble: 15 PetaFLOPS gracias a sus 640 Tensor Cores con NVFP4

NVIDIA-Blackwell-Ultra-SM

Lo de los GPC de NVIDIA es una locura. Como hemos comentado, tenemos 4 por cada die, 8 en total, donde cada uno alberga 20 SM, lo que hace que la GPU al completo Blackwell Ultra tenga 160 en total, 80 por cada die. Adentrándonos en un GPC y luego en un SM podemos ver los cambios que implementa NVIDIA con su característico diagrama.

Cada SM contiene 128 Shaders, o CUDA Cores, los cuales trabajan como ya sabemos con FP32 e INT32 además de otros formatos y precisiones. Lo interesante aquí es que cada uno de estos SM alberga 4 Tensor Cores de 5 Gen, los cuales contienen la segunda generación de Transformer Engine, siendo estos optimizados para FP8, FP6 y NVFP4.

Blackwell-Ultra-attention-mechanism

Además, cada SM tiene 256 KB de Tensor Memory (TMEM), repartidos en 64 KB por cada Tensor Core como motor independiente. Según NVIDIA, esto se ha dispuesto así para reducir el tráfico de la memoria hacia fuera de la GPU. Evidentemente, esta nueva unidad como tal implica que las SFU ahora hayan evolucionado, según los verdes, para una mejor matemática "trascendentales" y operaciones especiales que usan los núcleos en IA, aunque no dan más detalles.

Lo único que comentan anexo a esto es que sus SFU ahora son dos veces más rápidas que en comparación con Blackwell, y eso es realmente muy impresionante dentro de lo que se denomina como Attention Mechanism.

Memoria y Tensor Cores, dos pilares fundamentales para sostener el dominio en IA

NVIDIA-Blackwell-Ultra-ancho-de-banda-HBM3E

La memoria es uno de sus pilares fundamentales. Integra módulos HBM3E de alta capacidad (288 GB, nada menos que 3,6 veces la cantidad del H100), lo que permite afrontar entrenamientos de modelos de gran tamaño y razonamiento a tiempo real sin que el sistema se vea limitado por el acceso a datos. De este modo, Blackwell Ultra puede sostener cargas de trabajo donde la cantidad de contexto y el volumen de parámetros crecen de manera exponencial.

Esto se consigue también gracias a los 16 controladores de memoria con 512 bits cada uno (8.192 bits en total), lo que sumado a los 8 TB/s de cada stack deja un ancho de banda increíble de 3,35 TB/s en memoria. Los Tensor Cores de quinta generación son otra de las piezas clave. Mejoran el tratamiento de las capas de atención (con hasta el doble de velocidad respecto a la generación previa) y ofrecen un soporte más eficiente para cálculos en precisión mixta.

Interconexión Hopper GPU Blackwell GPU Blackwell Ultra GPU
NVLink (GPU-GPU) 900 GB/s 1,800 GB/s 1,800 GB/s
NVLink-C2C (CPU-GPU) 900 GB/s 900 GB/s 900 GB/s
Interfaz PCIe 128 GB/s (Gen 5) 256 GB/s (Gen 6) 256 GB/s (Gen 6)
Y claro, el elemento más innovador es el formato NVFP4, que combina características de FP8 con una escala FP32. Gracias a este diseño, la GPU logra 15 petaFLOPS de rendimiento en cálculos de precisión reducida, al mismo tiempo que reduce el consumo de memoria de manera drástica (hasta ocho veces menos que FP8 y 3,5 veces menos que FP16) por lo comentado arriba de TMEM.

Estas cifras sitúan a Blackwell Ultra en un nivel 1,5 veces superior al Blackwell estándar y 7,5 veces por encima de Hopper (representado por GPU como H100 o H200), lo cual, es casi ciencia ficción para el corto periodo de tiempo que ha pasado entre la arquitectura original y esta versión Ultra como mejora.

La GPU que piensa cambiar la definición de conectividad en rack

Blackwell-Ultra-Throughput-NVFP4-precision

El apartado de conectividad está igualmente reforzado. Blackwell Ultra se ha concebido para desplegarse en configuraciones masivas, con racks completos de GPU trabajando de manera coordinada. La arquitectura incluye compatibilidad con sistemas como GB300 NVL72 y con InfiniBand a 800 gigabits por segundo, todo ello soportado por NVLink de quinta generación, lo que permite escalar hasta cientos de GPUs en un mismo clúster sin que se pierda cohesión operativa.

El propósito de este despliegue tecnológico es claro: proporcionar la base de hardware para el concepto de FAB de IA, infraestructuras capaces de generar tokens a gran velocidad y a un coste mucho menor.

NVIDIA Grace Blackwell Ultra

Esto permite habilitar modelos de razonamiento avanzado, agentes inteligentes y servicios de inferencia en tiempo real, con una eficiencia sin precedentes. En definitiva, lo que buscan los centros de datos y las empresas que están pujando por dominar el sector desde el software.

De hecho, la topología máxima que puede alcanzar Blackwell Ultra es de nada menos que 576 GPU en configuración de NVL72 con 72 GPU, lo que significa un ancho de banda agregado de 130 TB/s, cifras de locura.

El software estará a la altura para tranquilidad de todos: NVIDIA presenta Dynamo

NVIDIA-Dynamo

La propuesta de NVIDIA no se limita al hardware, ya que el software es, quizás, lo mejor que tiene NVIDIA realmente. Acompañando a Blackwell Ultra se encuentra Dynamo, un Sistema Operativo orientado a la inferencia en entornos multi-GPU.

Esta plataforma coordina el reparto de tareas (por ejemplo, asignando GPU específicas al prefill o a la generación de tokens), optimiza la comunicación entre nodos con mejoras en NCCL que, según dice NVIDIA, reducen la latencia hasta cuatro veces, aprovecha InfiniBand para descargar operaciones directamente en la GPU y permite almacenar en disco la caché de atención para consultas repetidas.

Todo ello bajo un modelo de software abierto que facilita la adopción tanto por parte de grandes proveedores de servicios en la nube como de empresas más pequeñas. En conjunto, y para que se entienda, Blackwell Ultra y Dynamo representan la visión de NVIDIA de una infraestructura integral para la Inteligencia Artificial. Es decir, hardware y software haciendo uno en tándem perfecto para maximizar el rendimiento siendo específicos para la plataforma en concreto.

Blackwell Ultra no tiene competencia en el mercado, NVIDIA se hará de oro

Característica Hooper Blackwell Blackwell Ultra
Proceso de fabricación TSMC 4N TSMC 4NP TSMC 4NP
Transistores 80 Billones 208 Billones 208 Billones
Dies por GPU 1 2 2
Rendimiento NVFP4 dense y sparse 10 | 20 petaFLOPS 15 | 20 petaFLOPS
Rendimiento FP8 dense y sparse 2 | 4 petaFLOPS 5 | 10 petaFLOPS 5 | 10 petaFLOPS
Attention acceleration
(SFU EX2)
4,5 TeraExponentials/s 5 TeraExponentials/s 10,7 TeraExponentials/s
Capacidad máxima de HBM 80 GB HBM (H100) 
141 GB HBM3E (H200)
192 GB HBM3E 288 GB HBM3E
Ancho de banda máximo de HBM 3,35 TB/s (H100)
4,8 TB/s (H200)
8 TB/s 8 TB/s
Ancho de banda de NVLink 900 GB/s 1.800 GB/s 1.800 GB/s
Potencia máxima (TGP) Hasta 700W Hasta 1.200 W Hasta 1.400 W
A través de una combinación de silicio de última generación, memoria de gran ancho de banda, nuevos formatos numéricos, redes de interconexión a escala masiva y software diseñado para maximizar la eficiencia, la compañía busca establecer el estándar de referencia en la construcción de fábricas de IA, y esto es algo que, de momento, no tiene respuesta por sus rivales, como AMD e Intel.

Sea como fuere, Blackwell Ultra a tirado la puerta abajo y las empresas llevan haciendo cola meses, ahora entendemos mucho mejor los motivos. Y hasta aquí esta nueva GPU para IA, la cual, va a romper con todo lo establecido meses después de la llegada de su primera y más primitiva arquitectura.

boton whatsapp sharkinformatica
boton whatsapp sharkinformatica