Las RTX 5090 y RTX 6000 PRO sufren un error de reinicio de virtualización y se ofrecen 1.000 dólares para quien dé con la solución

Matias 6 Comments 2025-09-08 10:43:07

La última hornada de gráficas de gama alta de NVIDIA no está teniendo un arranque precisamente limpio, ni en gaming ni en WS. Tanto la RTX 5090 como la RTX 6000 PRO, los dos modelos más potentes, están dando dolores de cabeza en entornos de virtualización: cuando se usan en máquinas virtuales, pueden quedar totalmente congeladas hasta el punto de obligar a reiniciar todo el servidor. El fallo, reproducible en varios escenarios, ya está levantando ampollas entre desarrolladores y entusiastas y sin ir más lejos, CloudRift ofrece 1.000 dólares a quien dé con la resolución del problema de reinicio de la virtualización en ambas gráficas, RTX 5090 y RTX 6000 PRO.

CloudRift, una compañía que monta GPU para la nube dedicadas a proyectos de Inteligencia Artificial, y tras varias pruebas, descubrió que estas tarjetas dejan de responder al cabo de unos días de uso intensivo en máquinas virtuales, o incluso en momentos aleatorios durante los procesos de arranque y apagado. Están tan desesperados por solucionar el problema que no quieren esperar a la investigación de NVIDIA, y piden ayuda a la comunidad.

Las RTX 5090 y RTX 6000 PRO sufren un problema de reinicio de virtualización que está destrozando a CloudRift

NVIDIA-RTX-5090-y-RTX-6000-PRO-sufren-un-error-de-reinicio-de-virtualización-en-Linux

Lo más curioso del asunto es que el resto de gráficas que han probado, como las H100, B200 o incluso las RTX 4090, funcionan sin problemas. La diferencia está en que la familia Blackwell para consumo y ProViz, en teoría lo último y más brillante de NVIDIA, es la que se estrella.

La raíz del asunto parece estar en el proceso conocido como FLR (Function Level Reset) de PCIe. Este reinicio, que debería servir para limpiar el estado de la GPU al reasignarla, deja colgada la tarjeta en lugar de devolverla al ruedo. Los registros de sistema muestran mensajes como «no listo 65535 ms después de FLR; abandonando», y a partir de ahí la GPU pasa a ser un ladrillo hasta que alguien apague físicamente el host. Y claro, dado el precio por unidad de las tarjetas, tenerlas paradas es un problema gigante para una empresa que se dedica a lo que se dedica.

Lo curioso es que los síntomas son bastante consistentes según especifica CloudRift: encabezados PCI extraños (tipo 7f), configuraciones de dispositivo que devuelven basura, estados de energía que no cambian correctamente e incluso bloqueos breves del kernel. Aun así, las tarjetas siguen siendo reconocidas por lspci, lo que hace que el problema sea todavía más confuso para los administradores de sistemas que intentan levantar la máquina a toda costa. La compañía lo expresa así:

“En algunos de nuestros nodos con GPU RTX 5090 y RTX PRO 6000, las tarjetas a veces dejan de responder por completo, generalmente después de unos días de uso de la máquina virtual o en momentos aparentemente aleatorios durante el inicio/apagado. Una vez que esto sucede, la GPU no se puede reasignar. La única solución es reiniciar completamente el nodo.”

Los foros también reportan lo mismo, NVIDIA da como solución provisional instalar un kernel específico

Jensen Huang escondiendo GeForce RTX 5060

Los foros especializados tampoco se han quedado quietos. En diversos foros hay decenas de usuarios reportando bloqueos idénticos: el host muere tras apagar una VM y la GPU no vuelve, ni siquiera con un reinicio de Sistema Operativo. Cambiar parámetros como ASPM o ACS en PCIe no sirve de nada. Y lo peor es que con gráficas anteriores, como la RTX 4080 o la RTX 4090, estos sustos nunca aparecieron. Algunos comentarios ya indican que el problema está afectando a las CPU, lo cual, añade complejidad a esta historia:

“Mi host dejó de responder. Una depuración más exhaustiva muestra que la CPU del host se bloqueó ligeramente después de un tiempo de espera de FLO, tras apagar LinuxVM. No hubo problema con mi 4080 anterior.”

Ante el caos, CloudRift ha lanzado incluso una recompensa de 1.000 dólares para quien pueda dar con una solución o, como mínimo, con la causa raíz. Mientras tanto, NVIDIA ha recomendado de forma provisional instalar un kernel específico (proxmox-kernel-6.14.8-2-bpo12-pve/stable), que actúa como apaño temporal, eso sí, no es un arreglo definitivo, y la pelota queda en el tejado de los drivers oficiales o de un parche del kernel de Linux.

Hasta entonces, es lo único que parece ofrecer algo de estabilidad. Entendemos que NVIDIA está investigando el asunto y que debería ser corregido en breve dada la cantidad de usuarios y empresas afectadas, que van saliendo poco a poco a medida que la noticia se hace más grande, ya que muchos pensaban que era algo individualizado y no colectivo.

boton whatsapp sharkinformatica
boton whatsapp sharkinformatica