Programación y códigoAirLLM: modelos gigantes en una tarjeta gráfica pequeña (a cambio de paciencia)
Una librería de Python gratis (licencia Apache 2.0) que deja ejecutar modelos enormes en un ordenador modesto: en vez de meter todo el modelo en la tarjeta gráfica, lo carga capa a capa desde el disco. Así el propio proyecto corre un modelo de 70B con 4 GB de tarjeta, DeepSeek-V3 (671B) con unos 12 GB y hasta Kimi K3 (2,8 billones de parámetros) por debajo de 4 GB. No comprime ni recorta el modelo, pero se paga en velocidad: es para probar y para trabajar en local, no para el día a día.
Revisada el 2026-10-10
- Popularidad
- 35,6k
- Licencia
- Apache 2.0 (código abierto)
- Autor
- Gavin Li (lyogavin)
- Categoría
- Programación y código
Seguridad: revisada
El contenido es seguro; el instalador o el servicio externo no se auditan aquí.
¿Qué es?
Cuando quieres usar un modelo de IA en tu propio ordenador, el cuello de botella es la memoria de la tarjeta gráfica (la VRAM): un modelo de 70B no cabe. La gracia de AirLLM es cambiar el orden de las cosas: en vez de cargar el modelo entero en la tarjeta, lo guarda partido en capas en el disco y va cargando una capa, calculando, y pasando a la siguiente. Solo tiene una capa en memoria en cada momento, así que cabe donde no cabía.
Lo que corre, según sus propias cifras:
Esta tabla se desliza: arrástrala con el dedo para ver las columnas que faltan.
| Modelo | Tarjeta que pide |
|---|---|
| Llama 70B | 4 GB |
| Qwen3-235B | ~3 GB |
| DeepSeek-V3 (671B) | ~12 GB |
| Kimi K3 (2,8T) | 3,72 GB |
Y sin comprimir el modelo: no cuantiza, no destila ni poda, así que lo que dice el modelo debería ser el modelo de verdad. En la versión 4.0.0 también deja entrenar modelos grandes con poca VRAM (los pesos van en streaming y solo los adaptadores viven en la tarjeta).
¿Para qué me sirve?
- Probar modelos enormes sin comprar una tarjeta de 2.000 €: si tienes un PC normal con una GPU modesta, puedes ejecutar un 70B (lento) y verlo con tus ojos.
- Trabajar en privado y sin conexión: el modelo y los datos no salen de tu máquina; con modelos que tienen datos sensibles puede ser la única opción razonable.
- Investigar y trastear: comparar modelos, hacer pruebas de calidad, medir tiempos.
- En tu Mac: dicen que funciona en Mac con chip de Apple (serie M) con
mlxinstalado (solo Apple Silicon).
Lo que no es: un sustituto de ChatGPT o Claude para el día a día. Aquí la comodidad se paga con segundos por palabra.
Cómo se instala
pip install airllmY el ejemplo mínimo de su documentación (con un modelo pequeño para probar):
from airllm import AutoModel
MAX_LENGTH = 128
model = AutoModel.from_pretrained("Qwen/Qwen3-32B")
input_text = ['What is the capital of United States?']
input_tokens = model.tokenizer(input_text,
return_tensors="pt", return_attention_mask=False,
truncation=True, max_length=MAX_LENGTH, padding=False)
generation_output = model.generate(
input_tokens['input_ids'].cuda(),
max_new_tokens=20, use_cache=True, return_dict_in_generate=True)
print(model.tokenizer.decode(generation_output.sequences[0]))Truco propio de la librería para ganar velocidad: instalar bitsandbytes y pasar compression='4bit' al cargar el modelo (hasta 3 veces más rápido, según el proyecto). Y si el disco es justo, delete_original=True borra el modelo original y se queda solo con las capas ya partidas.
⚠️ Lo que hay que saber antes
- Es LENTO, y ese es el precio. El vídeo dice «un poco más lento»; en la práctica un modelo grande así tarda segundos por palabra. Sirve para probar y para trabajos de fondo, no para preguntar y ver la respuesta al momento.
- Pide disco y un disco rápido. La primera vez hay que descargar el modelo entero (un 671B son cientos de GB) y luego se parte en capas; el truco funciona solo si el disco va ligero (SSD), porque está leyendo constantemente.
- «Cancela todas tus suscripciones» es marketing. Esto ejecuta modelos abiertos en tu equipo; no te da un Claude ni un GPT, y no te ahorra el ordenador. Para uso normal, sigue siendo más práctico (y más rápido) usar un servicio.
- Instalación pesada: arrastra
torch(varios GB) mástransformers,acceleratey demás. - Los modelos con permiso (los de Meta, por ejemplo) piden un token de Hugging Face para descargarlos.
- El propio repositorio trae publicidad (enlaces de afiliado a otras webs, Patreon y patrocinadores). El código es libre y auditado por la comunidad; el README es de su autor, no de una empresa.
- No lo hemos probado en este equipo (aquí no hay tarjeta gráfica): lo de arriba está comprobado contra el repositorio, PyPI y su historial, no con una prueba corriendo.