Robótica (modelos de acción / VLA)GR00T N1.7 — El cerebro de NVIDIA para robots, que puedes descargar gratis
GR00T N1.7 es el modelo de NVIDIA para dar cerebro a robots, sobre todo humanoides. Es un modelo VLA, es decir, ve por las cámaras, entiende órdenes en lenguaje normal y las convierte en movimientos para el robot. Es abierto: el código es Apache 2.0 y los pesos se descargan gratis bajo la licencia abierta de NVIDIA. Tiene 3.000 millones de parámetros. La pega: no es para el ordenador de casa. Para probarlo hace falta una GPU de 16 GB y para entrenarlo, 40 GB o más, y además hay que pedir acceso a otro modelo en Hugging Face.
Revisada el 2026-10-09
- Popularidad
- 8176
- Licencia
- código Apache 2.0; pesos bajo la NVIDIA Open Model License (abierta y comercial, pero no es una licencia OSI)
- Categoría
- Robótica (modelos de acción / VLA)
Seguridad: revisada
El contenido es seguro; el instalador o el servicio externo no se auditan aquí.
¿Qué es?
NVIDIA Isaac GR00T N1.7 es el modelo de NVIDIA para dar «cerebro» a robots, sobre todo humanoides. Es un modelo VLA (siglas de vision-language-action: ve por las cámaras, entiende órdenes en lenguaje normal y las convierte en movimiento para el robot). No es un chatbot: su salida son acciones, es decir, órdenes para los motores del robot.
La versión actual es la N1.7, de 3.000 millones de parámetros (un tamaño medio). Por dentro lleva un modelo de visión y lenguaje (Cosmos-Reason2-2B, basado en Qwen3-VL) y una «cabeza» que genera las acciones. Está entrenada, entre otras cosas, con 20.000 horas de vídeo de personas haciendo tareas (proyecto EgoScale), para que aprenda trucos de manos sin teleoperar un robot miles de horas.
Una idea clave: es «cross-embodiment» (multi-cuerpo). El mismo modelo sirve para brazos y para humanoides distintos; luego se ajusta a cada robot con datos propios. NVIDIA lo publicó el 17 de abril de 2026 (entonces como acceso anticipado) y hoy está en versión estable (GA).
¿Para qué es especialista?
Para manipulación: coger, colocar, empaquetar, montar piezas pequeñas, inspeccionar... tareas de almacén y de fábrica. Y para humanoides, donde controla brazos y manos con muchos grados de libertad.
Lo bueno para quien investiga: como pesa poco (3B) y es abierto, se puede afinar (fine-tuning) con tus propios datos y tu propio robot, y luego correr en el propio robot (por ejemplo, una placa Jetson). Es la vía de NVIDIA para que cada empresa adapte el modelo a su máquina.
¿Es de frontera o pequeño? ¿Abierto o cerrado?
Es un modelo mediano (3.000 millones de parámetros), no gigante. No pretende competir con los modelos de lenguaje enormes: su trabajo es mover un robot.
Es abierto. El código está en GitHub bajo licencia Apache 2.0 y los pesos se descargan gratis en Hugging Face bajo la NVIDIA Open Model License. Ojo con el matiz: esa licencia de pesos es abierta y permite uso comercial, pero no está aprobada por la OSI (la organización que certifica el «código abierto» oficial). Traducido: puedes usarlo, incluso para vender, pero es la licencia de NVIDIA y tiene sus condiciones; no es Apache pura.
¿Cuánto cuesta?
El modelo es gratis. El código y los pesos se descargan sin pagar nada, y la licencia de NVIDIA permite uso comercial.
El coste real es el hardware:
- Para probar el modelo (inferencia): una GPU con 16 GB de VRAM o más (por ejemplo, una RTX 4090, una L40 o una H100).
- Para afinar (fine-tuning): 40 GB o más de VRAM por GPU; NVIDIA recomienda H100 o L40.
- También corre en placas Jetson (Thor, Orin) y en DGX Spark.
Es decir: cero euros en licencias, pero no se hace con un portátil normal.
⚠️ Lo que hay que saber antes
- Pide acceso antes de empezar. El modelo base carga una pieza llamada Cosmos-Reason2-2B que es de acceso restringido (gated) en Hugging Face: hay que pedir permiso en su página e iniciar sesión con un token. Sin eso, la descarga falla.
- Pide una GPU de verdad. 16 GB de VRAM para probarlo y 40 GB o más para entrenar. No es un modelo para el ordenador de casa.
- La licencia de los pesos no es OSI. Es la NVIDIA Open Model License: abierta y comercial, pero con sus reglas propias, no la definición oficial de «código abierto».
- Es un robot. Mover una máquina física tiene riesgo real: si el modelo se equivoca, algo puede caerse o romperse. Las pruebas se hacen en simulación o con supervisión.
- Documentación en inglés y pensada para quien sabe de robótica y de Python. No es plug-and-play.
¿Esto me sirve a mí?
Sirve si:
- Eres investigador, estudiante o empresa y quieres un modelo de acción abierto para tu robot humanoide o brazo.
- Tienes GPU y ganas de trastear con robótica (Python, simulación).
- Quieres una base para afinar con tus propios datos, sin pagar licencias.
No sirve si buscabas una app para tu ordenador de casa: necesita GPU potente, documentación técnica y un robot (o un simulador) para hacer algo útil.
¿Es seguro?
El modelo corre en tu máquina: no manda lo que graba tu robot a ningún servicio, salvo que tú lo conectes. Eso está bien para la privacidad.
Los matices: como es un modelo para robots físicos, el riesgo no es de datos, sino físico (que una máquina haga algo peligroso). Además, la descarga del modelo base exige identificarte en Hugging Face. Y la licencia de los pesos no es OSI, así que conviene leerla antes de usarlo en un producto.
¿Dónde funciona?
En tu equipo con GPU NVIDIA (o en placas Jetson y DGX Spark). Es descargable, así que aquí van los comandos reales del repositorio:
# 1) Clonar el repositorio (con submódulos)
git clone --recurse-submodules https://github.com/NVIDIA/Isaac-GR00T
cd Isaac-GR00T
# 2) Crear el entorno (usa "uv", un gestor de paquetes de Python)
uv sync --python 3.12
# 3) Iniciar sesión en Hugging Face (el modelo base es de acceso restringido)
uv run huggingface-cli login
# 4) Comprobar que se ha instalado
uv run python -c "import gr00t; print('GR00T installed successfully')"Necesitas también FFmpeg instalado (sudo apt-get install -y ffmpeg) y, si vas a afinar, configurar CUDA. La guía completa está en el README del repositorio.