La pelea por llevar los grandes LLM a dispositivos con recursos limitados, como portátiles o PC con NPU para IA, acaba de dar un salto importante. Intel ha demostrado que es posible ejecutar modelos de 1 y 2 bits en CPU x86 convencionales con un rendimiento que se acerca peligrosamente al de las GPU más vendidas, reduciendo a la vez consumo, latencia y memoria necesaria. La clave no ha sido crear nuevos modelos, sino reescribir la forma en la que se multiplican las matrices dentro de la CPU. ¿Cómo lo han conseguido? Con microkernels específicos para CPU Intel basados en aprovechar las instrucciones AVX2.
En lugar de trabajar con los clásicos 16 bits por peso (weight, es decir, el número de parámetros del modelo), los ingenieros han conseguido transformar matrices de 1 y 2 bits en enteros de 8 bits para luego explotarlos con operaciones FMA (fused-multiply-add). Lo que suena más o menos sencillo, realmente es complejo, y acerca increíblemente a Intel y sus CPU de una manera brutal con NVIDIA y sus modelos más vendidos.
El truco está en la disposición de los datos, concretamente, en el formato VNNI4-interleaved. Este reduce el coste de “empaquetar y desempaquetar” y se adelanta a los cuellos de botella que aparecen cuando se intenta procesar información tan comprimida con los LLM.
Los resultados son contundentes. En pruebas con tres chips Intel Core Ultra (el 285K de 24 núcleos, el 255H con 14 núcleos y el 258V de 8 Cores) los LLM para IA de 2 bits alcanzaron hasta siete veces la velocidad de la inferencia tradicional en 16 bits. Incluso en configuraciones más exigentes, como Llama3-8B, las CPU de los azules lograron acercarse a un tercio del rendimiento de una GPU NVIDIA A100, que cuenta con entre 17 y 20 veces más ancho de banda de memoria gracias a su HBM2E frente a la DDR5 tradicional.
En números prácticos: el A100 generó 250 tokens por segundo, mientras que las CPUs se quedaron en la franja de 82 a 110 dependiendo del modelo. La sorpresa es que la diferencia no es tan grande como cabría esperar, sobre todo teniendo en cuenta la disparidad de recursos entre ambos mundos, pero, sobre todo, evidencia que usando estos microkernerls con AVX2 el rendimiento se multiplicó por 7 veces en todas las CPU de Intel probadas y como media.
Frente a soluciones previas como bitnet.cpp, que hasta ahora era la referencia para modelos ternarios y de baja precisión, la propuesta de Intel marca distancias y se acerca más a lo que ofrece NVIDIA realmente. Donde bitnet.cpp apenas lograba mejoras discretas, los microkernels integrados en PyTorch-TPP duplicaron, e incluso superaron con holgura (ahí es nada) sus resultados, con aceleraciones de hasta 2,2 veces más rápidas en pruebas equivalentes.
Este cambio de rumbo es especialmente relevante en escenarios single-batch, típicos de los usos en cliente o en dispositivos de Edge, sobre todo en entornos de servidores, donde lo que importa no es procesar grandes lotes de datos en paralelo, sino responder rápido con recursos limitados.
Por sintetizar lo revelado por los azules, podemos decir que el impacto práctico de todo esto es claro: modelos como Falcon3-1B, MobileLLM-1.5B o Llama3-8B, que en teoría deberían quedar fuera del alcance de un PC o portátil común, pueden ejecutarse de forma viable en el llamado AI-PC.
Y no queda ahí la cosa. El ahorro en memoria es drástico (cuatro u ocho veces menos datos a mover), el consumo se reduce y el rendimiento escala de manera casi lineal con la disminución de bits. Igualmente, hay todavía escollos a superar, porque, aunque los experimentos con 1 bit siguen mostrando cuellos de botella, sobre todo en chips con menos núcleos, los de 2 bits ya marcan un estándar que abre la puerta a despliegues eficientes sin necesidad de hardware especializado.
Para rematar la faena, y en un movimiento que un servidor todavía no entiende más allá del hecho de que quieren frenar el uso de GPU de IA, Intel cierra el trabajo con la mirada puesta en el futuro: llevar estos mismos avances a CPU y SoC ARM. ¿Cómo van a lograr esto fuera de x86? Es una buena pregunta, y los datos aportados dicen que lo harán aprovechando instrucciones como AArch64 y SVE (Scalable Vector Extension), posiblemente también con SVE2.
Si logran replicar los resultados, la inferencia de ultra-bajo bit podría convertirse en la llave que permita a la Inteligencia Artificial de gran tamaño funcionar en cualquier lugar, desde un portátil hasta un PC, o un equipo Edge cualquiera. Esto es un golpe tremendo a la línea de flotación básica de NVIDIA, porque evidencia que el ahorro de costes de no tener que comprar una GPU extremadamente muy cara para inferencia, con LLM muy usados, es real y está cerca de ser implementado.
Imaginemos las posibilidades con AVX10.2 y posteriores (scalable vector length con hasta 512 bits, el doble que AVX2), en un servidor gigantesco, con muchísimo ancho de banda disponible en memoria. ¿Es un intento de jaque a NVIDIA y AMD? De momento, es un buen golpe que tiene que ser llevado a cabo de manera formal al mercado, y entonces, veremos cómo escala a mejor hardware. Lo que sí que parece claro es que no necesitaremos tanta gráfica en PC y portátiles, ya que con una CPU medianamente actual tendremos un rendimiento suficiente para estos LLM gracias a los microkernels de Intel con AVX2 y posteriores.
Para poder comprar, aprovechar las promociones y utilizar los medios de pago en nuestro sitio es requisitio estar correctamente registrado. En ningún momento recibirá correo electrónico que no haya solicitado. Pero se le pediran una serie de datos personales indispensables para cualquier operación comercial.
Los datos solicitados son necesarios para confeccionar la factura de los productos comprados y la dirección física para el envio de su compra.
Para más informació sobre nuestras políticas en el tratamiento de los datos personales visite la sección Terminos y Condiciones.
