Dime qué necesitas.
No hace falta saber cómo se llama nada. Escribe lo que quieres hacer con tus palabras y te digo qué te sirve.
40 resultados para «de-frontera»
Modelo — Imagen
FLUX (Black Forest Labs) — Calidad de frontera y abierto
FLUX es la familia de Black Forest Labs (creada por ex-ingenieros de Stability AI, los de Stable Diffusion). Su gran logro: calidad de frontera estando abierto. Con FLUX 3 Image (lo último) y FLUX.2 compite con GPT Image y Midjourney, y además puedes descargarlo y usarlo en tu PC. Ideal si quieres lo mejor sin depender de una nube.
Modelo — Texto y razonamiento
GLM (Zhipu AI) — El abierto que pelea con la frontera
GLM, de Zhipu AI (marca internacional Z.ai), es uno de los mejores modelos abiertos del mundo. Su versión actual, GLM-5.x (hasta 5.3), roza la frontera cerrada y cuesta una fracción. Es abierto (pesos públicos), barato y muy bueno en código y agentes. Ideal si quieres mucho por poco y poder autoalojarlo.
Modelo — Voz y audio
Cartesia (Sonic) — La voz más rápida para agentes
Cartesia es la empresa de su modelo de voz Sonic, famoso por ser el más rápido: empieza a sonar en ~90 milisegundos (y ~40 en modo Turbo), tan rápido que se siente conversación real. Su versión actual es Sonic-3.6 (44 idiomas, risas y emoción). Es frontera y cerrado, con capa gratis. Ideal para asistentes de voz, llamadas y chats que hablan.
Modelo — Texto y razonamiento
Claude (Anthropic) — El cerebro de programar y escribir
Claude es el cerebro de Anthropic y el favorito de muchos programadores. Su gama (2026): Opus 5.5 (el potente), Sonnet 5.5 (equilibrado), Haiku 4.5 (rápido y barato) y Fable 5.1 (tope de frontera). Es de frontera y cerrado. Su fama: programar muy bien, escribir con naturalidad y ser fiable en tareas largas.
Modelo — Texto y razonamiento
Doubao / Seed (ByteDance) — Barato y a lo grande
Doubao (la app) y Seed (los modelos) son de ByteDance, la dueña de TikTok. Su familia Seed 2.x es frontera y muy barata: compite con GPT/Gemini en muchas pruebas a una fracción del precio, y es multimodal (texto, imagen, voz, vídeo). Es cerrado. Ideal si quieres calidad a precio de saldo (y no te importa que sea chino).
Modelo — Voz y audio
ElevenLabs — El cerebro de las voces más reales
ElevenLabs es el rey del texto a voz: convierte un texto en una voz que suena humana de verdad. Además clona voces (la tuya, con tu permiso), dobla vídeos a otros idiomas y hace música y efectos. Es de frontera y cerrado, con plan gratis (sin uso comercial). Ideal para narraciones, podcasts, audiolibros y doblaje.
Modelo — Texto y razonamiento
Gemini (Google) — El cerebro con memoria gigante
Gemini es el cerebro de Google. Su gran baza es una memoria gigante (hasta 2 millones de "tokens", como leer libros enteros de una vez) y que es multimodal (entiende texto, imágenes, vídeo y audio). Su gama 2026: 3.1 Pro (el listo), 3.8 Flash (equilibrado y barato) y Flash-Lite (el más barato). Es frontera y cerrado, con capa gratis.
Modelo — Imagen
GPT Image (OpenAI) — El cerebro de dibujar y editar
GPT Image es el "cerebro de dibujar" de OpenAI (el mismo que genera imágenes dentro de ChatGPT). Su gama actual es ChatGPT Images 2.5. Es de frontera y cerrado. Destaca en entender bien lo que le pides, escribir texto legible dentro de la imagen y editar fotos. Lo más fácil: usarlo desde ChatGPT, sin instalar nada.
Modelo — Texto y razonamiento
GPT (OpenAI) — El cerebro más famoso
GPT es el cerebro de ChatGPT, el asistente de IA más conocido del mundo. Hoy su gama estrella es GPT-6, con tres niveles: Astra (el más listo y caro), Sol (equilibrado) y Luna (rápido y barato). Es de frontera (lo más potente) y cerrado (no te lo puedes descargar). Su punto fuerte: razonar, programar y hacer tareas largas solo.
Modelo — Texto y razonamiento
Grok (xAI) — El cerebro en tiempo real
Grok es el cerebro de xAI, la empresa de Elon Musk, y vive muy pegado a la red X (Twitter). Su gran baza es la información en tiempo real: puede mirar qué se dice ahora mismo en X. Su gama 2026: Grok 4.7 (el estrella). Es de frontera y cerrado, con capa gratis dentro de X, y tiene modelos propios de imagen, voz y vídeo.
Modelo — Texto y razonamiento
Kimi (Moonshot AI) — Gigante abierto y agéntico
Kimi, de Moonshot AI, es un modelo enorme (2,8 billones de parámetros) que publica sus pesos: la mayor "apertura" de un modelo de este tamaño. Su versión actual es Kimi K3 (julio 2026), con 1 millón de contexto, razonamiento siempre activo y alma de agente (hace tareas largas). Es frontera y abierto, gratis en su web. Ideal para código, investigación y tareas largas.
Modelo — Vídeo
Kling (Kuaishou) — El mejor movimiento humano
Kling, de Kuaishou (el "TikTok chino"), es de los mejores en lo más difícil del vídeo: personas moviéndose de forma realista (caminar, correr, bailar, deporte) y física creíble (agua, humo, telas). Su serie actual es Kling 2.x/3.0, con clips de 5–10 s que se pueden alargar hasta ~3 minutos. Es frontera y cerrado, con créditos gratis diarios. Ojo: es chino (privacidad).
Modelo — Vídeo
LTX (Lightricks) — Vídeo abierto en 4K con audio
LTX es el modelo de vídeo abierto de Lightricks (los de Facetune). Con LTX-2 (y su mejora LTX-2.5) consigue algo raro: 4K con audio sincronizado y pesos abiertos, además de uso comercial gratis por debajo de 10 M$ de facturación. Es frontera y abierto. Ideal si quieres vídeo de alta calidad en tu equipo, con ComfyUI y control total.
Modelo — Vídeo
Luma Dream Machine — Física, luz y escenas espaciales
Luma (su producto se llama Dream Machine) viene del mundo del 3D, y se nota: es de los mejores en física, profundidad y luz (agua, cristal, espacios, arquitectura, producto). Su modelo actual es Ray 3.2 (1080p nativo, rápido y más barato). Es frontera y cerrado, con plan gratis (con marca de agua). Ideal para visualizar productos, espacios y escenas con luz realista.
Modelo — Imagen
Midjourney — El cerebro más artístico
Midjourney es el rey del arte y el fotorrealismo: sus imágenes son, de media, las más bonitas de todas. Es de frontera y cerrado. Su pega: no tiene plan gratis (desde 10 $/mes) y se cobra por tiempo de "GPU", no por número de imágenes. Ideal si lo que buscas es estética espectacular (y no tanto texto o precisión).
Modelo — Texto y razonamiento
MiMo (Xiaomi) — El abierto que lidera y es omnimodal
MiMo es la familia de IA de Xiaomi (la del móvil). Su versión actual, MiMo-V2.6 (sep-2026), llegó a lo más alto de los rankings de modelos abiertos y es omnimodal: entiende texto, imagen, audio y vídeo de entrada, con 1M de contexto. Es frontera y abierto (MIT). Ideal para quien quiere lo mejor abierto y probar suerte autoalojándolo.
Modelo — Imagen
Nano Banana (Google) — El que entiende y edita imágenes
Nano Banana es el modelo de imagen de Google (por dentro se llama Gemini Image). Su nombre es un apodo que se hizo viral. Lo bueno: no solo dibuja, también entiende la imagen (razona sobre ella) y la edita conversando ("cámbiale el fondo", "quítale las gafas"). Va incluido en Gemini. Es frontera y cerrado, con capa gratis. De los mejores y más fáciles.
Modelo — Vídeo
Runway — El cerebro que genera y edita vídeo
Runway es de los pioneros del vídeo con IA, y su fuerte no es solo generar: también es un editor para trabajar el vídeo (cortar, efectos, quitar fondos, cambiar estilos). Su modelo actual es Gen-4.5. Es frontera y cerrado, con capa gratis (125 créditos y marca de agua). Ideal si quieres generar y luego montar en un mismo sitio.
Modelo — Vídeo
Seedance (ByteDance) — El vídeo más completo
Seedance es el modelo de vídeo de ByteDance (TikTok). Su versión actual, Seedance 2.5 (ago-2026), es de las más completas: clips de hasta 30 segundos, audio integrado, y acepta muchas referencias (imagen, vídeo y audio) para mantener personajes y estilo. Lidera varios rankings. Es frontera y cerrado. Ideal para narración larga, anuncios y coherencia de personaje.
Modelo — Voz y audio
Suno — El cerebro que compone canciones
Suno es el cerebro que compone canciones: le describes el estilo y la letra, y te devuelve una canción con voz e instrumentos. Es de frontera (el más usado del mundo para música con IA) y cerrado. Tiene plan gratis (50 créditos/día) y planes baratos. Ideal para jingles, música de fondo, demos o regalos. Ojo: su parte legal está aún en los tribunales.
Modelo — Vídeo
Veo (Google) — El mejor vídeo con audio
Veo es el modelo de vídeo de Google DeepMind, y hoy es el rey del vídeo con audio: genera clips con voz, sonido y efectos sincronizados. Su versión actual es Veo 3.1 (con niveles Lite, Fast y Quality) y se usa en Gemini y en Flow (el editor de vídeo de Google). Es frontera y cerrado, con capa gratis. Ideal para anuncios, escenas con diálogo y vídeo de redes.
Modelo — Vídeo
Wan (Alibaba) — El vídeo abierto que puedes autoalojar
Wan es el modelo de vídeo abierto de Alibaba, y es la gran excepción del sector: mientras casi todos los vídeos son cerrados, Wan publica sus pesos. Su versión actual es Wan 2.6: 1080p, audio sincronizado, multi-plano y hasta 15 segundos, con opción de referencias para mantener personajes. Es frontera y abierto. Ideal si quieres vídeo en tu propio equipo, gratis y privado.
Novedad — Cerebros
Google lanza Gemini 4 Argon, su modelo frontera (de momento solo para ciberdefensa)
El 30-sep-2026 Google anunció Gemini 4 Argon, su modelo más potente hasta la fecha, pensado para tareas largas y complejas. Eso sí: no lo puedes usar todavía. Primero se está dando solo a equipos de ciberdefensa (programa Fairwind) y más adelante llegará al público. Precio de entrada: 2 $ / 10 $ por millón de tokens.
Modelo — Vídeo
Hailuo (MiniMax) — Vídeo 2K con sonido propio, y ahora también abierto
Hailuo es el generador de vídeo de MiniMax (China). Su modelo actual es H3: entiende a la vez texto, imagen, vídeo y audio, y devuelve un clip de hasta 15 segundos en 2K de verdad (2560×1440) con sonido estéreo que crea él mismo, no añadido después. Se paga por segundos (unos 0,14 $ en 2K, o sea sobre 1,10 $ un clip de 8 s). Y la novedad de peso: sus pesos son abiertos, así que también se puede montar en un PC con buena tarjeta gráfica.
Modelo — Robótica (modelos de acción / VLA)
Helix 02 (Figure) — El cerebro que mueve un robot humanoide entero
Helix 02 es el «cerebro» con el que la empresa Figure AI mueve su robot humanoide (el Figure 03). No es un chatbot: es un modelo de acción, la clase de IA que mira lo que ve el robot y decide cómo mover cada articulación para hacer una tarea física, desde andar hasta coger un vaso. Une vista, lenguaje y movimiento en un solo sistema: le dices «recoge los platos» y el robot lo hace entero y solo. Está cerrado del todo: no se puede descargar, ni llamar por API, ni usar sin ser Figure.
Modelo — Robótica (modelos de acción / VLA)
Skild Brain / S1 — El cerebro robótico que aprende viendo un vídeo
Skild Brain es el «cerebro» robótico de la empresa Skild AI, y S1 es su modelo estrella (presentado en agosto de 2026). Su idea es distinta a la de otros: en vez de entrenar cada tarea durante semanas, aprende viendo un solo vídeo. Le enseñas cómo se hace algo, aunque no lo haya hecho nunca, y lo copia sin reentrenar. Funciona en robots de muchos tipos (brazos, cuadrúpedos, humanoides). Está cerrado y es solo para empresas: no hay descarga, ni API pública, ni precio.
Modelo — Texto y razonamiento
DeepSeek — El cerebro más barato (y abierto)
DeepSeek es el cerebro chino que rompió el mercado por precio. Da una calidad casi de frontera por una décima parte del coste de los grandes. Su gama 2026: V4.1 Flash (baratísimo) y V4-Pro (más fuerte), con 1 millón de contexto y modo "pensar". Y lo mejor: sus pesos son abiertos (MIT), así que puedes autoalojarlo gratis en tu equipo. Ideal para ahorrar y para código.
Modelo — Texto y razonamiento
Llama (Meta) — El cerebro abierto para tu propio PC
Llama es la familia abierta de Meta (Facebook/Instagram). Su gran valor: los pesos son públicos, así que puedes descargarlo y ejecutarlo en tu propio ordenador o servidor, sin que tus datos salgan y sin pagar por uso. La última generación abierta consolidada es la Llama 4; en 2026 Meta empuja su trabajo de frontera bajo una marca nueva (Muse). Ideal para quien quiere privacidad y no depender de nadie.
Novedad — Cerebros
OpenAI lanza GPT-6 (Astra, Sol y Luna)
OpenAI presentó su familia GPT-6 con tres niveles: Astra (el tope), Sol (equilibrado) y Luna (rápido y barato). El de frontera (Astra) cuesta ~10 $ / 50 $ por millón de tokens.
MCP — Datos e IA
fal MCP (oficial) — Más de 1.000 modelos para dibujar y crear
El servidor MCP oficial de fal.ai: conectas tu IA a una URL y le das tu clave, y desde ahí puede buscar y ejecutar más de 1.000 modelos (Flux, SDXL, y modelos de vídeo, audio y 3D). La IA elige el modelo adecuado sola y lo lanza, con precios a la vista antes de gastar.
Modelo — Texto y razonamiento
Amazon Nova — Los cerebros de Amazon (texto, imagen y vídeo)
Amazon Nova son los "cerebros" de Amazon. Hay varios niveles (de baratos a potentes) para texto, y también para imagen (Nova Canvas) y vídeo (Nova Reel). Se usan desde Amazon Bedrock (su plataforma en la nube). Es cerrado, pero con capa gratis para probar.
Modelo — Texto y razonamiento
Gemma (Google) — Pequeño, abierto y para tu PC
Gemma es la familia abierta y pequeña de Google (hermana menor de Gemini). Su versión actual, Gemma 4, es multimodal (texto, imagen, vídeo, OCR y hasta audio en las versiones pequeñas) y está pensada para correr en tu PC o móvil. Es ligera y gratis. Ideal si quieres IA privada, sin pagar y en tu equipo.
Modelo — Texto y razonamiento
gpt-oss (OpenAI) — Los modelos abiertos de OpenAI
gpt-oss son los modelos abiertos de OpenAI: sí, la casa de ChatGPT también regala pesos. Vienen en dos tamaños (20B y 120B), con 256K de contexto y razonamiento (niveles bajo/medio/alto). Son equilibrados, gratis y Apache 2.0. Ideal si quieres la "filosofía" de OpenAI pero en tu PC y sin pagar.
Modelo — Imagen
Grok Imagine (xAI) — Imagen y vídeo desde Grok
Grok Imagine es la herramienta de imagen y vídeo de xAI (la empresa de Grok, en X). Crea imágenes y también vídeos desde una descripción. Es cerrado, pero se usa dentro de Grok/X (con límites gratis). En el catálogo, grok es el de texto; este es el de crear imágenes/vídeo.
Modelo — Texto y razonamiento
Nemotron (NVIDIA) — Abierto, transparente y para agentes
Nemotron es la familia de modelos de NVIDIA. Su gracia es que es abierta y muy transparente: publica los pesos e incluso datos y recetas de entrenamiento, algo poco habitual. Está muy pensada para agentes y razonamiento. Se puede descargar y usar en tu propio equipo.
Modelo — Imagen
Qwen-Image (Alibaba) — Modelo de imagen abierto, fuerte con texto
Qwen-Image es el modelo de imagen de Alibaba (la familia Qwen, que en el catálogo aparece para texto). Es abierto (se puede descargar) y de los mejores escribiendo texto dentro de la imagen (carteles, rótulos). También edita imágenes. Su versión actual es Qwen-Image-2.1 (7B, de pesos abiertos).
Modelo — Texto y razonamiento
Qwen (Alibaba) — El cerebro abierto y multilingüe
Qwen (se pronuncia "chuen") es la familia de Alibaba y la más completa del mundo abierto: tiene modelos desde 0,6 mil millones hasta más de 2 billones de parámetros, casi todos abiertos (Apache 2.0) y gratis de usar. Especialista en idiomas (más de 200) y en correr en tu propio PC. Su gama 2026: Qwen3.5 (397B abierto), Plus y Flash. Ideal si quieres modelos abiertos, gratis y locales.
Modelo — Vídeo
Higgsfield — La caja de vídeo con más de 30 modelos (de pago)
Higgsfield es una plataforma de vídeo e imagen con más de 30 modelos dentro (Sora 2, Kling 3.0, Veo 3.1, Seedance 2.5, Wan 2.6…) y herramientas propias de cine. Se paga: desde 15 $ al mes, y cada clip gasta créditos (~2,55 $ uno de 8 segundos con Seedance 2.5 en 720p). Ojo: no tiene prueba gratis — la capa gratis lleva pocos modelos y cero créditos.
Modelo — Robótica (modelos de acción / VLA)
Gemini Robotics 2 — El cerebro de Google para robots (solo por invitación)
Gemini Robotics 2 es el modelo de Google DeepMind que convierte lo que ve un robot y tus órdenes en movimientos. Es un modelo VLA, es decir, ve, entiende el lenguaje y decide acciones para que el robot se mueva. Controla brazos y humanoides enteros, con manos y pinzas muy precisas, y hasta coordina varios robots a la vez. Está cerrado: solo se puede usar por invitación, en fase de acceso anticipado («private preview»). No se descarga, no se vende y no hay precios públicos.
Modelo — Robótica (modelos de acción / VLA)
π0.7 (pi-0.7) — El modelo que dobla la ropa con un robot que nunca lo había hecho (cerrado)
π0.7 es el modelo de Physical Intelligence (empresa de Estados Unidos) que convierte lo que ve un robot y tus órdenes en movimientos. Es un modelo VLA, es decir, ve, entiende el lenguaje y decide acciones para que el robot se mueva. Tiene unos 5.000 millones de parámetros. Lo llamativo: hace tareas nuevas sin entrenamiento previo, como doblar ropa en un robot que nunca lo había hecho, y acepta órdenes más ricas que un simple «haz esto». La pega gorda: está cerrado. Publicaron el estudio y los vídeos, no los pesos, así que no se puede descargar.