Si tienes una NVIDIA GeForce RTX con 16 GB de VRAM, ahora puedes ejecutar tu propia IA de alto rendimiento de forma local

Matias 6 Comments 2025-08-09 10:43:13

Si tienes una gráfica NVIDIA GeForce RTX o RTX Pro, debes saber que ya puedes usar modelos avanzados de inteligencia artificial sin pagar una suscripción. Y lo más importante, sin necesidad de una conexión a Internet. Y es que en la tarde de ayer NVIDIA anunció una colaboración con OpenAI, compañía detrás del ya más que archiconocido chatbot ChatGPT.

Esta colaboración con OpenAI permite ejecutar localmente potentes modelos LLM como gpt‑oss‑20b y gpt‑oss‑120b, ideales para tareas de razonamiento avanzado, codificación asistida, búsquedas inteligentes o análisis de documentos.

Esta integración llega optimizada para varias herramientas compatibles con Windows y Linux

uso de modelos de IA OpenAI en forma local - NVIDIA GeForce RTX - uso Ollama

  • Ollama: la forma más sencilla de usar estos modelos. Seleccionas uno e inicias chat, sin configuración adicional. Soporta además PDFs, prompts multimodales y contexto ajustable.
  • Microsoft AI Foundry Local: permite usar los modelos vía comandos o integraciones SDK. Está basado en ONNX Runtime y se apoya en CUDA y TensorRT para aprovechar al máximo las GPUs RTX.
  • llama.cpp: para usuarios avanzados, NVIDIA colabora con la comunidad open-source y contribuye con optimizaciones como Flash Attention, CUDA Graphs y soporte para el nuevo formato MBFP4.

Como breve contexto, esta colaboración entre NVIDIA y OpenAI abre la puerta a que desarrolladores y entusiastas puedan ejecutar IA generativa localmente, con mayor velocidad, privacidad y sin dependencia de la nube. Una gran noticia si trabajas en entornos sin conexión o buscas control total sobre tus modelos.

Para usuarios domésticos, el que interesa es el gpt‑oss‑20b, ahora bien, al igual que en gaming, necesitarás cono mínimo una GPU con 16 GB de VRAM. Recomendándose una GeForce RTX 4080 hacia delante. Como referencia, el rendimiento local ronda los 256 tokens por segundo en equipos con una GeForce RTX 5090.

Para empresas y servidores, gpt‑oss‑120b requiere una GPU con al menos 80 GB de VRAM, por lo que hay que recurrir a las GPU NVIDIA Blackwell para servidores. En plataformas como la GB200 NVL72, alcanzan hasta 1,5 millones de tokens por segundo, suficiente para decenas de miles de usuarios concurrentes.

Básicamente, estamos ante la democratización de la IA de alto nivel en ordenadores de escritorio con NVIDIA y OpenAI

uso de modelos de IA OpenAI en forma local - NVIDIA GeForce RTX - agentes

En esencia, todo esto se traduce en que NVIDIA y OpenAI están llevando los LLMs avanzados al escritorio con un enfoque realista. Que es usar lo que ya tienes (una GeForce RTX) para tener una potente IA sin necesidad de pagar una suscripción o depender de la nube. Con herramientas como Ollama y el soporte de llama.cpp o Foundry Local, esto ya es una realidad para usuarios exigentes, desarrolladores y curiosos.

Ampliando el resumen, usar la IA de manera local es clave para la privacidad, velocidad y entornos desconectados. A ello se le suma que no hay ningún coste recurrente como el de una suscripción. Tienes control total sobre los modelos que tú ejecutas, todo ello sin depender de API externas.

Terminamos con tener una base para crear agentes autónomos. Y es que puedes integrar estas IAs con herramientas locales o de red, lo que da pie a asistentes y agentes personalizados mucho más potentes. Y sí, todo ello por medio de tu GPU NVIDIA GeForce RTX que únicamente usas para jugar y, ahora si eres tanto un curioso como profesional, tendrá un valor añadido.

boton whatsapp sharkinformatica
boton whatsapp sharkinformatica