Modelos
Los motores: cuál te conviene y para qué.
52 fichas revisadas
Filtrar por categoría
Mostrando 52 fichas
- C
Texto y razonamiento
Claude (Anthropic) — El cerebro de programar y escribir
Claude es el cerebro de Anthropic y el favorito de muchos programadores. Su gama (2026): Opus 5.5 (el potente), Sonnet 5 (equilibrado), Haiku 4.5 (rápido y barato) y Fable 5.1 (tope de frontera). Es de frontera y cerrado. Su fama: programar muy bien, escribir con naturalidad y ser fiable en tareas largas.
9/10
- D
Texto y razonamiento
DeepSeek — El cerebro más barato (y abierto)
DeepSeek es el cerebro chino que rompió el mercado por precio. Da una calidad casi de frontera por una décima parte del coste de los grandes. Su gama 2026: V4-Flash (baratísimo) y V4-Pro (más fuerte), con 1 millón de contexto y modo "pensar". Y lo mejor: sus pesos son abiertos (MIT), así que puedes autoalojarlo gratis en tu equipo. Ideal para ahorrar y para código.
9/10
- E
Voz y audio
ElevenLabs — El cerebro de las voces más reales
ElevenLabs es el rey del texto a voz: convierte un texto en una voz que suena humana de verdad. Además clona voces (la tuya, con tu permiso), dobla vídeos a otros idiomas y hace música y efectos. Es de frontera y cerrado, con plan gratis (sin uso comercial). Ideal para narraciones, podcasts, audiolibros y doblaje.
9/10
- F
Imagen
FLUX (Black Forest Labs) — Calidad de frontera y abierto
FLUX es la familia de Black Forest Labs (creada por ex-ingenieros de Stability AI, los de Stable Diffusion). Su gran logro: calidad de frontera estando abierto. Con la versión FLUX.2 compite con GPT Image y Midjourney, y además puedes descargarlo y usarlo en tu PC. Ideal si quieres lo mejor sin depender de una nube.
9/10
- G
Texto y razonamiento
Gemini (Google) — El cerebro con memoria gigante
Gemini es el cerebro de Google. Su gran baza es una memoria gigante (hasta 2 millones de "tokens", como leer libros enteros de una vez) y que es multimodal (entiende texto, imágenes, vídeo y audio). Su gama 2026: 3.1 Pro (el listo), 3.8 Flash (equilibrado y barato) y Flash-Lite (el más barato). Es frontera y cerrado, con capa gratis.
9/10
- G
Texto y razonamiento
GLM (Zhipu AI) — El abierto que pelea con la frontera
GLM, de Zhipu AI (marca internacional Z.ai), es uno de los mejores modelos abiertos del mundo. Su versión actual, GLM-5.x (hasta 5.3), roza la frontera cerrada y cuesta una fracción. Es abierto (pesos públicos), barato y muy bueno en código y agentes. Ideal si quieres mucho por poco y poder autoalojarlo.
9/10
- G
Imagen
GPT Image (OpenAI) — El cerebro de dibujar y editar
GPT Image es el "cerebro de dibujar" de OpenAI (el mismo que genera imágenes dentro de ChatGPT). Su gama actual es GPT Image 2. Es de frontera y cerrado. Destaca en entender bien lo que le pides, escribir texto legible dentro de la imagen y editar fotos. Lo más fácil: usarlo desde ChatGPT, sin instalar nada.
9/10
- G
Texto y razonamiento
GPT (OpenAI) — El cerebro más famoso
GPT es el cerebro de ChatGPT, el asistente de IA más conocido del mundo. Hoy su gama estrella es GPT-6, con tres niveles: Astra (el más listo y caro), Sol (equilibrado) y Luna (rápido y barato). Es de frontera (lo más potente) y cerrado (no te lo puedes descargar). Su punto fuerte: razonar, programar y hacer tareas largas solo.
9/10
- K
Texto y razonamiento
Kimi (Moonshot AI) — Gigante abierto y agéntico
Kimi, de Moonshot AI, es un modelo enorme (2,8 billones de parámetros) que publica sus pesos: la mayor "apertura" de un modelo de este tamaño. Su versión actual es Kimi K3 (julio 2026), con 1 millón de contexto, razonamiento siempre activo y alma de agente (hace tareas largas). Es frontera y abierto, gratis en su web. Ideal para código, investigación y tareas largas.
9/10
- M
Texto y razonamiento
MiMo (Xiaomi) — El abierto que lidera y es omnimodal
MiMo es la familia de IA de Xiaomi (la del móvil). Su versión actual, MiMo-V2.6 (sep-2026), llegó a lo más alto de los rankings de modelos abiertos y es omnimodal: entiende texto, imagen, audio y vídeo de entrada, con 1M de contexto. Es frontera y abierto (MIT). Ideal para quien quiere lo mejor abierto y probar suerte autoalojándolo.
9/10
- N
Imagen
Nano Banana (Google) — El que entiende y edita imágenes
Nano Banana es el modelo de imagen de Google (por dentro se llama Gemini Image). Su nombre es un apodo que se hizo viral. Lo bueno: no solo dibuja, también entiende la imagen (razona sobre ella) y la edita conversando ("cámbiale el fondo", "quítale las gafas"). Va incluido en Gemini. Es frontera y cerrado, con capa gratis. De los mejores y más fáciles.
9/10
- S
Vídeo
Seedance (ByteDance) — El vídeo más completo
Seedance es el modelo de vídeo de ByteDance (TikTok). Su versión actual, Seedance 2.5 (ago-2026), es de las más completas: clips de hasta 30 segundos, audio integrado, y acepta muchas referencias (imagen, vídeo y audio) para mantener personajes y estilo. Lidera varios rankings. Es frontera y cerrado. Ideal para narración larga, anuncios y coherencia de personaje.
9/10
- V
Vídeo
Veo (Google) — El mejor vídeo con audio
Veo es el modelo de vídeo de Google DeepMind, y hoy es el rey del vídeo con audio: genera clips con voz, sonido y efectos sincronizados. Su versión actual es Veo 3.1 (con niveles Lite, Fast y Quality) y se usa en Gemini y en Flow (el editor de vídeo de Google). Es frontera y cerrado, con capa gratis. Ideal para anuncios, escenas con diálogo y vídeo de redes.
9/10
- W
Voz y audio
Whisper (OpenAI) — El cerebro que pasa voz a texto
Whisper es el modelo de voz a texto de OpenAI, y es abierto (MIT): puedes descargarlo y transcribir gratis en tu PC. Soporta ~99 idiomas, aguanta acentos y ruido, y genera subtítulos con marcas de tiempo. Es equilibrado, gratis y privado. Ideal para pasar vídeos, reuniones o notas de voz a texto.
9/10
- C
Voz y audio
Cartesia (Sonic) — La voz más rápida para agentes
Cartesia es la empresa de su modelo de voz Sonic, famoso por ser el más rápido: empieza a sonar en ~90 milisegundos (y ~40 en modo Turbo), tan rápido que se siente conversación real. Su versión actual es Sonic-3.6 (44 idiomas, risas y emoción). Es frontera y cerrado, con capa gratis. Ideal para asistentes de voz, llamadas y chats que hablan.
8/10
- D
Texto y razonamiento
Doubao / Seed (ByteDance) — Barato y a lo grande
Doubao (la app) y Seed (los modelos) son de ByteDance, la dueña de TikTok. Su familia Seed 2.x es frontera y muy barata: compite con GPT/Gemini en muchas pruebas a una fracción del precio, y es multimodal (texto, imagen, voz, vídeo). Es cerrado. Ideal si quieres calidad a precio de saldo (y no te importa que sea chino).
8/10
- G
Texto y razonamiento
Gemma (Google) — Pequeño, abierto y para tu PC
Gemma es la familia abierta y pequeña de Google (hermana menor de Gemini). Su versión actual, Gemma 4, es multimodal (texto, imagen, vídeo, OCR y hasta audio en las versiones pequeñas) y está pensada para correr en tu PC o móvil. Es ligera y gratis. Ideal si quieres IA privada, sin pagar y en tu equipo.
8/10
- G
Texto y razonamiento
gpt-oss (OpenAI) — Los modelos abiertos de OpenAI
gpt-oss son los modelos abiertos de OpenAI: sí, la casa de ChatGPT también regala pesos. Vienen en tres tamaños (8B, 20B y 120B), con 256K de contexto y razonamiento (niveles bajo/medio/alto). Son equilibrados, gratis y Apache 2.0. Ideal si quieres la "filosofía" de OpenAI pero en tu PC y sin pagar.
8/10
- G
Texto y razonamiento
Grok (xAI) — El cerebro en tiempo real
Grok es el cerebro de xAI, la empresa de Elon Musk, y vive muy pegado a la red X (Twitter). Su gran baza es la información en tiempo real: puede mirar qué se dice ahora mismo en X. Su gama 2026: Grok 4.7 (el estrella). Es de frontera y cerrado, con capa gratis dentro de X, y tiene modelos propios de imagen, voz y vídeo.
8/10
- H
Vídeo
Hailuo (MiniMax) — Vídeo realista y económico
Hailuo es el modelo de vídeo de MiniMax. Su versión actual, Hailuo 2.3, destaca en movimiento realista, microexpresiones y estilo, y es de los mejores en relación calidad/precio del sector. Es frontera y cerrado, con créditos gratis. Ideal si quieres buen vídeo sin gastar mucho.
8/10
- H
Texto y razonamiento
Hunyuan (Tencent) — Abierto, eficiente y multimodal
Hunyuan es la familia de Tencent (la del WeChat). Su serie Hy3 / Hy4 es abierta (Apache 2.0) y muy eficiente: un modelo enorme que solo "enciende" una parte pequeña al responder, así que gasta poco y da buen resultado en agentes y búsqueda con herramientas. Es equilibrado y abierto. Ideal si quieres buen rendimiento con poca máquina.
8/10
- I
Imagen
Ideogram — El cerebro que escribe dentro de la imagen
Ideogram nació con una idea: la IA dibuja fatal el texto dentro de las imágenes. Y lo resolvió. Hoy es el mejor escribiendo letras legibles (carteles, logos, infografías, portadas), con ~90% de acierto frente al ~30% de otras. Es equilibrado y cerrado, con plan gratis (10 imágenes/día) y planes baratos. Ideal para gráficos con palabras.
8/10
- K
Vídeo
Kling (Kuaishou) — El mejor movimiento humano
Kling, de Kuaishou (el "TikTok chino"), es de los mejores en lo más difícil del vídeo: personas moviéndose de forma realista (caminar, correr, bailar, deporte) y física creíble (agua, humo, telas). Su serie actual es Kling 2.x/3.0, con clips de 5–10 s que se pueden alargar hasta ~3 minutos. Es frontera y cerrado, con créditos gratis diarios. Ojo: es chino (privacidad).
8/10
- K
Voz y audio
Kokoro — Voz gratis que corre en tu PC (sin GPU)
Kokoro es un modelo de texto a voz abierto y diminuto (82 millones de parámetros, ~327 MB): corre en tu PC incluso sin tarjeta gráfica. Suena sorprendentemente bien para lo pequeño que es, con 54 voces en 8 idiomas. Es ligero, gratis y Apache 2.0. No clona voces (son voces fijas). Ideal para narración local gratis y privada.
8/10
- L
Texto y razonamiento
Llama (Meta) — El cerebro abierto para tu propio PC
Llama es la familia abierta de Meta (Facebook/Instagram). Su gran valor: los pesos son públicos, así que puedes descargarlo y ejecutarlo en tu propio ordenador o servidor, sin que tus datos salgan y sin pagar por uso. La última generación abierta consolidada es la Llama 4; en 2026 Meta empuja su trabajo de frontera bajo una marca nueva (Muse). Ideal para quien quiere privacidad y no depender de nadie.
8/10
- L
Vídeo
LTX (Lightricks) — Vídeo abierto en 4K con audio
LTX es el modelo de vídeo abierto de Lightricks (los de Facetune). Con LTX-2 (y su mejora LTX-2.3) consigue algo raro: 4K con audio sincronizado y pesos abiertos, además de uso comercial gratis por debajo de 10 M$ de facturación. Es frontera y abierto. Ideal si quieres vídeo de alta calidad en tu equipo, con ComfyUI y control total.
8/10
- L
Vídeo
Luma Dream Machine — Física, luz y escenas espaciales
Luma (su producto se llama Dream Machine) viene del mundo del 3D, y se nota: es de los mejores en física, profundidad y luz (agua, cristal, espacios, arquitectura, producto). Su modelo actual es Ray 3.14 (1080p nativo, rápido y más barato). Es frontera y cerrado, con plan gratis (con marca de agua). Ideal para visualizar productos, espacios y escenas con luz realista.
8/10
- M
Imagen
Midjourney — El cerebro más artístico
Midjourney es el rey del arte y el fotorrealismo: sus imágenes son, de media, las más bonitas de todas. Es de frontera y cerrado. Su pega: no tiene plan gratis (desde 10 $/mes) y se cobra por tiempo de "GPU", no por número de imágenes. Ideal si lo que buscas es estética espectacular (y no tanto texto o precisión).
8/10
- M
Texto y razonamiento
MiniMax — Agéntico, abierto y barato
MiniMax es una empresa china con un modelo abierto, barato y pensado para "agentes": su serie M2.x (actual M2.7) hace tareas largas de varios pasos sin dispararse de precio. Es equilibrado y abierto. Ideal si quieres automatizar tareas con buena relación calidad/precio pudiendo autoalojarlo.
8/10
- M
Texto y razonamiento
Mistral — El cerebro europeo (abierto y con RGPD)
Mistral es el cerebro europeo (Francia). Su bandera: ser abierto, barato y cumplir el RGPD (tus datos en Europa, algo que no ofrecen los gigantes americanos). Tiene de todo: Large 3 (el listo), Small 4 (abierto), Ministral (diminutos), y especialistas: Codestral (código), Magistral (razonar), Voxtral (voz). Ideal si te importa la privacidad europea o quieres modelos abiertos.
8/10
- N
Texto y razonamiento
Nemotron (NVIDIA) — Abierto, transparente y para agentes
Nemotron es la familia de modelos de NVIDIA. Su gracia es que es abierta y muy transparente: publica los pesos e incluso datos y recetas de entrenamiento, algo poco habitual. Está muy pensada para agentes y razonamiento. Se puede descargar y usar en tu propio equipo.
8/10
- O
Voz y audio
OpenAI TTS — Voz natural y barata
OpenAI TTS es el "texto a voz" de OpenAI. No es tan expresivo como ElevenLabs, pero suena natural, es muy barato y va dentro de tu misma cuenta de OpenAI (la de ChatGPT/API). Su modelo estrella, gpt-4o-mini-tts, permite decirle cómo hablar ("tono cálido, con pausas"). No clona voces. Ideal para voz en tu web o app gastando poco.
8/10
- Q
Imagen
Qwen-Image (Alibaba) — Modelo de imagen abierto, fuerte con texto
Qwen-Image es el modelo de imagen de Alibaba (la familia Qwen, que en el catálogo aparece para texto). Es abierto (se puede descargar) y de los mejores escribiendo texto dentro de la imagen (carteles, rótulos). También edita imágenes.
8/10
- Q
Texto y razonamiento
Qwen (Alibaba) — El cerebro abierto y multilingüe
Qwen (se pronuncia "chuen") es la familia de Alibaba y la más completa del mundo abierto: tiene modelos desde 0,6 mil millones hasta más de 2 billones de parámetros, casi todos abiertos (Apache 2.0) y gratis de usar. Especialista en idiomas (más de 200) y en correr en tu propio PC. Su gama 2026: Qwen3.5 (397B abierto), Plus y Flash. Ideal si quieres modelos abiertos, gratis y locales.
8/10
- R
Imagen
Recraft — El que hace gráficos vectoriales editables
Recraft hace algo que casi nadie: generar gráficos vectoriales (SVG) editables, no solo fotos. Eso lo hace ideal para logos, iconos e ilustraciones que luego quieres escalar y retocar sin perder calidad. Su versión actual es V4.1 (con modo "Styles" para mantener el mismo estilo en toda la marca). Es equilibrado y cerrado, con plan gratis. Ideal para identidad visual y diseño.
8/10
- R
Vídeo
Runway — El cerebro que genera y edita vídeo
Runway es de los pioneros del vídeo con IA, y su fuerte no es solo generar: también es un editor para trabajar el vídeo (cortar, efectos, quitar fondos, cambiar estilos). Su modelo actual es Gen-4.5. Es frontera y cerrado, con capa gratis (125 créditos y marca de agua). Ideal si quieres generar y luego montar en un mismo sitio.
8/10
- S
Voz y audio
Stable Audio (Stability AI) — Música y efectos, en parte abierto
Stable Audio (de Stability AI, los de Stable Diffusion) genera música y efectos de sonido entrenados con datos con licencia (un punto a favor legal). Su versión actual es Stable Audio 3.0, con tres modelos abiertos (descargables) y uno (Large) por API. Es equilibrado y en parte abierto. Ideal para música de fondo y efectos que luego puedes usar sin sustos legales.
8/10
- S
Imagen
Stable Diffusion (Stability AI) — El rey de lo abierto
Stable Diffusion (de Stability AI) es el abuelo y el rey del "local": la primera gran IA de imágenes abierta, y la que más comunidad tiene. Con él, generas gratis en tu propio PC, sin límites y con control total (estilos, modelos afinados, LoRAs...). Sus modelos (SDXL, SD3.5) son abiertos. Ideal si quieres trastear, no pagar y tener privacidad.
8/10
- S
Voz y audio
Suno — El cerebro que compone canciones
Suno es el cerebro que compone canciones: le describes el estilo y la letra, y te devuelve una canción con voz e instrumentos. Es de frontera (el más usado del mundo para música con IA) y cerrado. Tiene plan gratis (50 créditos/día) y planes baratos. Ideal para jingles, música de fondo, demos o regalos. Ojo: su parte legal está aún en los tribunales.
8/10
- U
Voz y audio
Udio — Canciones con IA (con los pies en la tierra legal)
Udio es el gran rival de Suno para crear canciones con IA: describes el estilo (o pegas la letra) y te saca una canción cantada. Su calidad es de las mejores, y tras llegar a un acuerdo con Universal Music (UMG) en 2026, su parte legal es más sólida. Es equilibrado y cerrado, con plan gratis. Ideal para canciones y experimentos musicales.
8/10
- W
Vídeo
Wan (Alibaba) — El vídeo abierto que puedes autoalojar
Wan es el modelo de vídeo abierto de Alibaba, y es la gran excepción del sector: mientras casi todos los vídeos son cerrados, Wan publica sus pesos. Su versión actual es Wan 2.6: 1080p, audio sincronizado, multi-plano y hasta 15 segundos, con opción de referencias para mantener personajes. Es frontera y abierto. Ideal si quieres vídeo en tu propio equipo, gratis y privado.
8/10
- A
Texto y razonamiento
Amazon Nova — Los cerebros de Amazon (texto, imagen y vídeo)
Amazon Nova son los "cerebros" de Amazon. Hay varios niveles (de baratos a potentes) para texto, y también para imagen (Nova Canvas) y vídeo (Nova Reel). Se usan desde Amazon Bedrock (su plataforma en la nube). Es cerrado, pero con capa gratis para probar.
7/10
- C
Vídeo
CogVideoX — Vídeo con IA, de código abierto
CogVideoX es un modelo de vídeo con IA de código abierto, creado por Zhipu AI con la universidad Tsinghua. Convierte texto (o una imagen) en un vídeo corto. La versión pequeña (2B) es Apache-2.0 y se puede descargar y usar en tu equipo.
7/10
- C
Texto y razonamiento
Command (Cohere) — El cerebro para empresas y datos
Command es la familia de Cohere, una empresa centrada en empresas: lo suyo es que tu IA trabaje sobre TUS datos (documentos, bases de conocimiento) de forma fiable y privada. Famosos son también sus modelos auxiliares Rerank y Embed, básicos para buscar dentro de tus datos. Es equilibrado y de licencia mixta. Ideal si montas un buscador o un asistente sobre tus documentos y te importa la privacidad.
7/10
- E
Texto y razonamiento
ERNIE (Baidu) — El cerebro chino del buscador
ERNIE es el modelo de Baidu (el "Google chino"). Su gran baza es la integración con su buscador y su base de conocimiento, así que es fuerte en datos actuales y en chino. Su familia actual es ERNIE 4.5, con precios muy bajos. Es equilibrado y de licencia mixta (algunos abiertos, los tope cerrados). Ideal si tu público es chino o quieres barato.
7/10
- F
Texto y razonamiento
Falcon (TII) — Abierto y ligero (corre en una GPU)
Falcon es la familia de modelos abiertos del instituto TII (Emiratos Árabes Unidos). Su punto fuerte es que son ligeros: las versiones pequeñas caben y corren en una sola GPU, así que son muy prácticos para tu propio equipo o para gastar poco.
7/10
- G
Texto y razonamiento
Granite (IBM) — Abierto y pensado para empresa
Granite es la familia de modelos abiertos de IBM, pensada para empresas: buenos en tareas de negocio (resúmenes, RAG, código) y con licencia Apache-2.0. Se pueden descargar y usar en tu equipo, y también por la nube de IBM.
7/10
- G
Imagen
Grok Imagine (xAI) — Imagen y vídeo desde Grok
Grok Imagine es la herramienta de imagen y vídeo de xAI (la empresa de Grok, en X). Crea imágenes y también vídeos desde una descripción. Es cerrado, pero se usa dentro de Grok/X (con límites gratis). En el catálogo, grok es el de texto; este es el de crear imágenes/vídeo.
7/10
- L
Imagen
Leonardo — Una caja con muchos modelos dentro
Leonardo (de Canva) ya no es "un modelo", sino una caja con muchos modelos dentro: los suyos (Lucid, Phoenix) y los de otros (Nano Banana Pro, Flux.2, Seedream, Veo, Kling...). Además te deja entrenar tu propio modelo con tus imágenes y hacer vídeo. Es equilibrado y cerrado, con capa gratis. Ideal para quien quiere probar muchos modelos desde un solo sitio.
7/10
- O
Texto y razonamiento
OLMo (AI2) — El más abierto de todos
OLMo es la familia de modelos del AI2 (instituto de investigación de EE. UU.). Es el más abierto que hay: publica los pesos, los datos de entrenamiento y el código, con licencia Apache-2.0. No es el más potente, pero es el rey de la transparencia y la reproducibilidad.
7/10
- P
Texto y razonamiento
Phi (Microsoft) — Pequeños que rinden mucho
Phi es la familia de modelos pequeños de Microsoft: la idea es que un modelo diminuto (que cabe en tu PC o móvil) haga una tarea concreta casi tan bien como uno gigante. Su gama llega a Phi-4 (con versión de razonamiento y visión) y Phi-5. Son ligeros, abiertos (MIT) y gratis. Ideales para clasificar, resumir o extraer datos en tu equipo.
7/10
- V
Voz y audio
Voxtral (Mistral) — Entiende el audio y habla
Voxtral es la familia de audio y voz de Mistral (la misma casa del cerebro mistral). Entiende lo que se dice en un audio (transcribe y responde sobre ello) y también genera voz. Es abierta, así que se puede descargar y usar en tu equipo.
7/10