Dime qué necesitas.
No hace falta saber cómo se llama nada. Escribe lo que quieres hacer con tus palabras y te digo qué te sirve.
17 resultados para «gpu»
Modelo — Texto y razonamiento
Falcon (TII) — Abierto y ligero (corre en una GPU)
Falcon es la familia de modelos abiertos del instituto TII (Emiratos Árabes Unidos). Su punto fuerte es que son ligeros: las versiones pequeñas caben y corren en una sola GPU, así que son muy prácticos para tu propio equipo o para gastar poco.
Modelo — Voz y audio
Kokoro — Voz gratis que corre en tu PC (sin GPU)
Kokoro es un modelo de texto a voz abierto y diminuto (82 millones de parámetros, ~327 MB): corre en tu PC incluso sin tarjeta gráfica. Suena sorprendentemente bien para lo pequeño que es, con 54 voces en 8 idiomas. Es ligero, gratis y Apache 2.0. No clona voces (son voces fijas). Ideal para narración local gratis y privada.
Modelo — Robótica (modelos de acción / VLA)
GR00T N1.7 — El cerebro de NVIDIA para robots, que puedes descargar gratis
GR00T N1.7 es el modelo de NVIDIA para dar cerebro a robots, sobre todo humanoides. Es un modelo VLA, es decir, ve por las cámaras, entiende órdenes en lenguaje normal y las convierte en movimientos para el robot. Es abierto: el código es Apache 2.0 y los pesos se descargan gratis bajo la licencia abierta de NVIDIA. Tiene 3.000 millones de parámetros. La pega: no es para el ordenador de casa. Para probarlo hace falta una GPU de 16 GB y para entrenarlo, 40 GB o más, y además hay que pedir acceso a otro modelo en Hugging Face.
MCP — Diseño y Frontend
ComfyUI MCP — Dibujo total en tu ordenador (Stable Diffusion / Flux)
Conecta tu IA con ComfyUI, el "taller" de Stable Diffusion/Flux que corre en tu propio ordenador. Así puedes dibujar (y crear vídeo/audio/3D) sin pagar por imagen y con total privacidad, porque nada sale de tu máquina. A cambio, es avanzado: hay que montar ComfyUI y tener una GPU decente.
Modelo — Imagen
Midjourney — El cerebro más artístico
Midjourney es el rey del arte y el fotorrealismo: sus imágenes son, de media, las más bonitas de todas. Es de frontera y cerrado. Su pega: no tiene plan gratis (desde 10 $/mes) y se cobra por tiempo de "GPU", no por número de imágenes. Ideal si lo que buscas es estética espectacular (y no tanto texto o precisión).
Novedad — CLIs
Nvidia lleva Hermes Agent a tu propio PC: IA local en un clic y sin nube
Nvidia anunció en la feria IFA 2026 que Hermes Agent (Nous Research) tendrá configuración de modelo local en un clic en ordenadores con GPU RTX y DGX: Windows primero y Linux después. La idea es descargar y usar el modelo en tu propia máquina, sin pasar por la nube y sin que tus datos salgan de casa. Además llega NVIDIA PAIR, que reparte el trabajo entre varios PCs de la misma red, y en octubre salen los primeros equipos compactos RTX Spark (de Lenovo y Acer).
Skill — Datos e IA
NVIDIA Skills (oficial) — IA física, robótica y CUDA
El catálogo oficial de NVIDIA de skills para agentes: enseñan a la IA a usar el software de NVIDIA (IA física, robótica, simulación, CUDA, RAG y "Blueprints"). Son skills verificadas por NVIDIA y actualizadas a diario. Es de nicho: está pensado para quien trabaja con el ecosistema NVIDIA, no para una web normal.
Modelo — Vídeo
CogVideoX — Vídeo con IA, de código abierto
CogVideoX es un modelo de vídeo con IA de código abierto, creado por Zhipu AI con la universidad Tsinghua. Convierte texto (o una imagen) en un vídeo corto. La versión pequeña (2B) es Apache-2.0 y se puede descargar y usar en tu equipo.
Modelo — Imagen
FLUX (Black Forest Labs) — Calidad de frontera y abierto
FLUX es la familia de Black Forest Labs (creada por ex-ingenieros de Stability AI, los de Stable Diffusion). Su gran logro: calidad de frontera estando abierto. Con FLUX 3 Image (lo último) y FLUX.2 compite con GPT Image y Midjourney, y además puedes descargarlo y usarlo en tu PC. Ideal si quieres lo mejor sin depender de una nube.
Modelo — Texto y razonamiento
gpt-oss (OpenAI) — Los modelos abiertos de OpenAI
gpt-oss son los modelos abiertos de OpenAI: sí, la casa de ChatGPT también regala pesos. Vienen en dos tamaños (20B y 120B), con 256K de contexto y razonamiento (niveles bajo/medio/alto). Son equilibrados, gratis y Apache 2.0. Ideal si quieres la "filosofía" de OpenAI pero en tu PC y sin pagar.
Modelo — Vídeo
Hailuo (MiniMax) — Vídeo 2K con sonido propio, y ahora también abierto
Hailuo es el generador de vídeo de MiniMax (China). Su modelo actual es H3: entiende a la vez texto, imagen, vídeo y audio, y devuelve un clip de hasta 15 segundos en 2K de verdad (2560×1440) con sonido estéreo que crea él mismo, no añadido después. Se paga por segundos (unos 0,14 $ en 2K, o sea sobre 1,10 $ un clip de 8 s). Y la novedad de peso: sus pesos son abiertos, así que también se puede montar en un PC con buena tarjeta gráfica.
Modelo — Vídeo
LTX (Lightricks) — Vídeo abierto en 4K con audio
LTX es el modelo de vídeo abierto de Lightricks (los de Facetune). Con LTX-2 (y su mejora LTX-2.5) consigue algo raro: 4K con audio sincronizado y pesos abiertos, además de uso comercial gratis por debajo de 10 M$ de facturación. Es frontera y abierto. Ideal si quieres vídeo de alta calidad en tu equipo, con ComfyUI y control total.
Modelo — Texto y razonamiento
Nemotron (NVIDIA) — Abierto, transparente y para agentes
Nemotron es la familia de modelos de NVIDIA. Su gracia es que es abierta y muy transparente: publica los pesos e incluso datos y recetas de entrenamiento, algo poco habitual. Está muy pensada para agentes y razonamiento. Se puede descargar y usar en tu propio equipo.
Modelo — Imagen
Stable Diffusion (Stability AI) — El rey de lo abierto
Stable Diffusion (de Stability AI) es el abuelo y el rey del "local": la primera gran IA de imágenes abierta, y la que más comunidad tiene. Con él, generas gratis en tu propio PC, sin límites y con control total (estilos, modelos afinados, LoRAs...). Sus modelos (SDXL, SD3.5) son abiertos. Ideal si quieres trastear, no pagar y tener privacidad.
Modelo — Vídeo
Wan (Alibaba) — El vídeo abierto que puedes autoalojar
Wan es el modelo de vídeo abierto de Alibaba, y es la gran excepción del sector: mientras casi todos los vídeos son cerrados, Wan publica sus pesos. Su versión actual es Wan 2.6: 1080p, audio sincronizado, multi-plano y hasta 15 segundos, con opción de referencias para mantener personajes. Es frontera y abierto. Ideal si quieres vídeo en tu propio equipo, gratis y privado.
Modelo — Voz y audio
Whisper (OpenAI) — El cerebro que pasa voz a texto
Whisper es el modelo de voz a texto de OpenAI, y es abierto (MIT): puedes descargarlo y transcribir gratis en tu PC. Soporta ~99 idiomas, aguanta acentos y ruido, y genera subtítulos con marcas de tiempo. Es equilibrado, gratis y privado. Ideal para pasar vídeos, reuniones o notas de voz a texto.
Modelo — Robótica (modelos de acción / VLA)
π0.7 (pi-0.7) — El modelo que dobla la ropa con un robot que nunca lo había hecho (cerrado)
π0.7 es el modelo de Physical Intelligence (empresa de Estados Unidos) que convierte lo que ve un robot y tus órdenes en movimientos. Es un modelo VLA, es decir, ve, entiende el lenguaje y decide acciones para que el robot se mueva. Tiene unos 5.000 millones de parámetros. Lo llamativo: hace tareas nuevas sin entrenamiento previo, como doblar ropa en un robot que nunca lo había hecho, y acepta órdenes más ricas que un simple «haz esto». La pega gorda: está cerrado. Publicaron el estudio y los vídeos, no los pesos, así que no se puede descargar.