Intel consigue que sus CPU se acerquen al rendimiento de la NVIDIA A100 en IA con microkernels de 1 y 2 bit, 7 veces más rápidas en inferencia de 16 bits

Matias 6 Comments 2025-08-25 10:43:04

La pelea por llevar los grandes LLM a dispositivos con recursos limitados, como portátiles o PC con NPU para IA, acaba de dar un salto importante. Intel ha demostrado que es posible ejecutar modelos de 1 y 2 bits en CPU x86 convencionales con un rendimiento que se acerca peligrosamente al de las GPU más vendidas, reduciendo a la vez consumo, latencia y memoria necesaria. La clave no ha sido crear nuevos modelos, sino reescribir la forma en la que se multiplican las matrices dentro de la CPU. ¿Cómo lo han conseguido? Con microkernels específicos para CPU Intel basados en aprovechar las instrucciones AVX2.

En lugar de trabajar con los clásicos 16 bits por peso (weight, es decir, el número de parámetros del modelo), los ingenieros han conseguido transformar matrices de 1 y 2 bits en enteros de 8 bits para luego explotarlos con operaciones FMA (fused-multiply-add). Lo que suena más o menos sencillo, realmente es complejo, y acerca increíblemente a Intel y sus CPU de una manera brutal con NVIDIA y sus modelos más vendidos.

Intel logra aumentar el rendimiento de sus CPU en IA con microkernels que usan AVX2

Intel-microkernels-para-sus-CPU-con-AVX2-de-INT2-a-INT32

El truco está en la disposición de los datos, concretamente, en el formato VNNI4-interleaved. Este reduce el coste de “empaquetar y desempaquetar” y se adelanta a los cuellos de botella que aparecen cuando se intenta procesar información tan comprimida con los LLM.

Los resultados son contundentes. En pruebas con tres chips Intel Core Ultra (el 285K de 24 núcleos, el 255H con 14 núcleos y el 258V de 8 Cores) los LLM para IA de 2 bits alcanzaron hasta siete veces la velocidad de la inferencia tradicional en 16 bits. Incluso en configuraciones más exigentes, como Llama3-8B, las CPU de los azules lograron acercarse a un tercio del rendimiento de una GPU NVIDIA A100, que cuenta con entre 17 y 20 veces más ancho de banda de memoria gracias a su HBM2E frente a la DDR5 tradicional.

En números prácticos: el A100 generó 250 tokens por segundo, mientras que las CPUs se quedaron en la franja de 82 a 110 dependiendo del modelo. La sorpresa es que la diferencia no es tan grande como cabría esperar, sobre todo teniendo en cuenta la disparidad de recursos entre ambos mundos, pero, sobre todo, evidencia que usando estos microkernerls con AVX2 el rendimiento se multiplicó por 7 veces en todas las CPU de Intel probadas y como media.

Intel acerca el uso de cualquier LLM actual a PC y portátiles sin depender de CPU de alto rendimiento como la de los servidores

Ancho-de-banda-entre-P-Cores-y-E-Cores-con-2-bit-y-1-bit-GEMV-en-CPU-con-microckernels-de-Intel

Frente a soluciones previas como bitnet.cpp, que hasta ahora era la referencia para modelos ternarios y de baja precisión, la propuesta de Intel marca distancias y se acerca más a lo que ofrece NVIDIA realmente. Donde bitnet.cpp apenas lograba mejoras discretas, los microkernels integrados en PyTorch-TPP duplicaron, e incluso superaron con holgura (ahí es nada) sus resultados, con aceleraciones de hasta 2,2 veces más rápidas en pruebas equivalentes.

Este cambio de rumbo es especialmente relevante en escenarios single-batch, típicos de los usos en cliente o en dispositivos de Edge, sobre todo en entornos de servidores, donde lo que importa no es procesar grandes lotes de datos en paralelo, sino responder rápido con recursos limitados.

Por sintetizar lo revelado por los azules, podemos decir que el impacto práctico de todo esto es claro: modelos como Falcon3-1B, MobileLLM-1.5B o Llama3-8B, que en teoría deberían quedar fuera del alcance de un PC o portátil común, pueden ejecutarse de forma viable en el llamado AI-PC.

Los azules no quieren quedarse en x86: quieren llevar estos microkernels a las CPU y SoC Arm, pero sin usar AVX2

Y no queda ahí la cosa. El ahorro en memoria es drástico (cuatro u ocho veces menos datos a mover), el consumo se reduce y el rendimiento escala de manera casi lineal con la disminución de bits. Igualmente, hay todavía escollos a superar, porque, aunque los experimentos con 1 bit siguen mostrando cuellos de botella, sobre todo en chips con menos núcleos, los de 2 bits ya marcan un estándar que abre la puerta a despliegues eficientes sin necesidad de hardware especializado.

Para rematar la faena, y en un movimiento que un servidor todavía no entiende más allá del hecho de que quieren frenar el uso de GPU de IA, Intel cierra el trabajo con la mirada puesta en el futuro: llevar estos mismos avances a CPU y SoC ARM. ¿Cómo van a lograr esto fuera de x86? Es una buena pregunta, y los datos aportados dicen que lo harán aprovechando instrucciones como AArch64 y SVE (Scalable Vector Extension), posiblemente también con SVE2.

Token-entre-285K-y-255H

Si logran replicar los resultados, la inferencia de ultra-bajo bit podría convertirse en la llave que permita a la Inteligencia Artificial de gran tamaño funcionar en cualquier lugar, desde un portátil hasta un PC, o un equipo Edge cualquiera. Esto es un golpe tremendo a la línea de flotación básica de NVIDIA, porque evidencia que el ahorro de costes de no tener que comprar una GPU extremadamente muy cara para inferencia, con LLM muy usados, es real y está cerca de ser implementado.

Imaginemos las posibilidades con AVX10.2 y posteriores (scalable vector length con hasta 512 bits, el doble que AVX2), en un servidor gigantesco, con muchísimo ancho de banda disponible en memoria. ¿Es un intento de jaque a NVIDIA y AMD? De momento, es un buen golpe que tiene que ser llevado a cabo de manera formal al mercado, y entonces, veremos cómo escala a mejor hardware. Lo que sí que parece claro es que no necesitaremos tanta gráfica en PC y portátiles, ya que con una CPU medianamente actual tendremos un rendimiento suficiente para estos LLM gracias a los microkernels de Intel con AVX2 y posteriores.

boton whatsapp sharkinformatica
boton whatsapp sharkinformatica