Dime qué necesitas.
No hace falta saber cómo se llama nada. Escribe lo que quieres hacer con tus palabras y te digo qué te sirve.
40 resultados para «modelo-de-acción»
Modelo — Robótica (modelos de acción / VLA)
π0.7 (pi-0.7) — El modelo que dobla la ropa con un robot que nunca lo había hecho (cerrado)
π0.7 es el modelo de Physical Intelligence (empresa de Estados Unidos) que convierte lo que ve un robot y tus órdenes en movimientos. Es un modelo VLA, es decir, ve, entiende el lenguaje y decide acciones para que el robot se mueva. Tiene unos 5.000 millones de parámetros. Lo llamativo: hace tareas nuevas sin entrenamiento previo, como doblar ropa en un robot que nunca lo había hecho, y acepta órdenes más ricas que un simple «haz esto». La pega gorda: está cerrado. Publicaron el estudio y los vídeos, no los pesos, así que no se puede descargar.
Modelo — Robótica (modelos de acción / VLA)
Helix 02 (Figure) — El cerebro que mueve un robot humanoide entero
Helix 02 es el «cerebro» con el que la empresa Figure AI mueve su robot humanoide (el Figure 03). No es un chatbot: es un modelo de acción, la clase de IA que mira lo que ve el robot y decide cómo mover cada articulación para hacer una tarea física, desde andar hasta coger un vaso. Une vista, lenguaje y movimiento en un solo sistema: le dices «recoge los platos» y el robot lo hace entero y solo. Está cerrado del todo: no se puede descargar, ni llamar por API, ni usar sin ser Figure.
Modelo — Robótica (modelos de acción / VLA)
Gemini Robotics 2 — El cerebro de Google para robots (solo por invitación)
Gemini Robotics 2 es el modelo de Google DeepMind que convierte lo que ve un robot y tus órdenes en movimientos. Es un modelo VLA, es decir, ve, entiende el lenguaje y decide acciones para que el robot se mueva. Controla brazos y humanoides enteros, con manos y pinzas muy precisas, y hasta coordina varios robots a la vez. Está cerrado: solo se puede usar por invitación, en fase de acceso anticipado («private preview»). No se descarga, no se vende y no hay precios públicos.
Novedad — Modelos
Un laboratorio del noreste de India entrena desde cero su propio modelo abierto
Navdyut AI Labs, un laboratorio de dos fundadores con sede en Guwahati (Assam, India) y sin inversores, ha publicado en Hugging Face un modelo generativo de 240 millones de parámetros entrenado desde cero, sin partir de pesos de Meta o Google. Es el primero del noreste del país que hace algo así y el mayor de una familia que arrancó con 15 millones. Su apuesta es la eficiencia: trabajan con reglas de escalado tipo Chinchilla y diseñan el modelo para funcionar sobre tarjetas AMD en lugar de las CUDA de Nvidia, para escapar del cuello de botella de los chips. Lo siguiente son versiones de 480 y 960 millones de parámetros, ya con llamadas a herramientas.
Modelo — Robótica (modelos de acción / VLA)
GR00T N1.7 — El cerebro de NVIDIA para robots, que puedes descargar gratis
GR00T N1.7 es el modelo de NVIDIA para dar cerebro a robots, sobre todo humanoides. Es un modelo VLA, es decir, ve por las cámaras, entiende órdenes en lenguaje normal y las convierte en movimientos para el robot. Es abierto: el código es Apache 2.0 y los pesos se descargan gratis bajo la licencia abierta de NVIDIA. Tiene 3.000 millones de parámetros. La pega: no es para el ordenador de casa. Para probarlo hace falta una GPU de 16 GB y para entrenarlo, 40 GB o más, y además hay que pedir acceso a otro modelo en Hugging Face.
Modelo — Robótica (modelos de acción / VLA)
Skild Brain / S1 — El cerebro robótico que aprende viendo un vídeo
Skild Brain es el «cerebro» robótico de la empresa Skild AI, y S1 es su modelo estrella (presentado en agosto de 2026). Su idea es distinta a la de otros: en vez de entrenar cada tarea durante semanas, aprende viendo un solo vídeo. Le enseñas cómo se hace algo, aunque no lo haya hecho nunca, y lo copia sin reentrenar. Funciona en robots de muchos tipos (brazos, cuadrúpedos, humanoides). Está cerrado y es solo para empresas: no hay descarga, ni API pública, ni precio.
MCP — Datos e IA
Hugging Face MCP (oficial) — IA y Modelos
Conector oficial de Hugging Face (la mayor comunidad de IA): buscar modelos y datasets, usar Spaces y apps de IA (generar imágenes, transcribir...) y explorar el Hub. Es la puerta de entrada a miles de herramientas de IA gratis.
Modelo — Imagen
Leonardo — Una caja con muchos modelos dentro
Leonardo (de Canva) ya no es "un modelo", sino una caja con muchos modelos dentro: los suyos (Lucid, Phoenix) y los de otros (Nano Banana Pro, Flux.2, Seedream, Veo, Kling...). Además te deja entrenar tu propio modelo con tus imágenes y hacer vídeo. Es equilibrado y cerrado, con capa gratis. Ideal para quien quiere probar muchos modelos desde un solo sitio.
Modelo — Vídeo
Higgsfield — La caja de vídeo con más de 30 modelos (de pago)
Higgsfield es una plataforma de vídeo e imagen con más de 30 modelos dentro (Sora 2, Kling 3.0, Veo 3.1, Seedance 2.5, Wan 2.6…) y herramientas propias de cine. Se paga: desde 15 $ al mes, y cada clip gasta créditos (~2,55 $ uno de 8 segundos con Seedance 2.5 en 720p). Ojo: no tiene prueba gratis — la capa gratis lleva pocos modelos y cero créditos.
Modelo — Texto y razonamiento
Nex-N2.5 — El modelo chino que tiene versión gratis en OpenRouter
Nex-N2.5 es la familia de modelos de la empresa china Nex-AGI, hecha para tareas de agente: mirar la pantalla, manejar el navegador, programar y comprobar por sí misma si lo que ha hecho funciona. Tiene tres tamaños (mini, Pro y Max), hasta 262.000 tokens de contexto y una versión gratis en OpenRouter, pero con tope: 20 peticiones por minuto y 50 al día. En calidad va por detrás de Claude y de GPT; su fuerte es el precio.
Programa — Automatización y agentes
OmniRoute: una sola puerta para todos tus modelos de IA (y qué es una pasarela)
Una pasarela de IA es un intermediario que se pone entre tu programa y los modelos: tú llamas a una sola dirección y ella decide a qué proveedor va cada petición. OmniRoute es una de código abierto y muy activa: reúne cientos de proveedores y modelos detrás de una única dirección, con reintentos, respaldo si uno falla y caché para no pagar dos veces la misma pregunta.
Novedad — Modelos
Brasil publica un modelo abierto que decide en vez de escribir
Under Labs, el laboratorio de una empresa brasileña de infraestructura con sede en Porto Alegre, ha liberado decisor-4b, un modelo de 4.000 millones de parámetros pensado para elegir una opción entre varias, no para redactar. Le das un estado, una pregunta y la lista de respuestas posibles, y devuelve la opción elegida con su probabilidad, calculada en una sola pasada. Está entrenado para portugués de Brasil y para el terreno jurídico y fiscal, donde frente a Qwen3.5-4B pasa del 57% al 75% de aciertos en 1.621 preguntas adaptadas. Los pesos están en Hugging Face con licencia Apache-2.0 y sus autores avisan de que no sirve como única base para decisiones sobre personas.
Novedad — Modelos
Nace el Arabic AI Atlas: un mapa abierto con más de mil modelos de IA en árabe
Un profesional de la IA de Riad, Hesham Haroon, ha publicado el Arabic AI Atlas, un mapa que reúne el ecosistema de la IA en árabe y que ahora mismo tiene 3.302 fichas: 1.163 conjuntos de datos, 393 modelos de lenguaje, 313 herramientas, 174 sistemas de reconocimiento de voz, 85 de síntesis de voz y 51 de reconocimiento de texto en imágenes, entre otros. Se puede filtrar por país, por dialecto (árabe estándar, magrebí, del Golfo, darija, egipcio) y por licencia, y los datos se actualizan a diario. Arabia Saudí va primera con 355 entradas, por delante de Emiratos Árabes Unidos, Egipto, Catar y Marruecos. Los datos se publican con licencia libre (CC BY 4.0) y el código es abierto (MIT). Además funciona como conector para agentes de IA: un agente puede consultarlo y recomendar el modelo que mejor encaja.
Novedad — Modelos
Los modelos chinos se quedan a solo un 3% de los de EE.UU.
Bloomberg Intelligence mide que la distancia entre los mejores modelos chinos y los estadounidenses se ha recortado al 3% (era del 9% en mayo y del 15% en enero). El último empujón lo dio DeepSeek V4.1 Flash, que se coló sexto en el ranking LiveBench con 81,1 puntos, frente a los 83,4 del Fable 5.1 de Anthropic.
Novedad — Modelos
Mistral Large 4 («Le Chonk»): el modelo europeo más grande ya se puede probar
Mistral ha abierto la vista previa pública de su modelo más grande: 1,05 billones de parámetros totales y 49.000 millones activos, contexto de 1 millón de tokens y, en su API, 0,68 $ por millón de tokens de entrada y 2,09 $ de salida. Los pesos (las «tripas» del modelo) están anunciados para finales de octubre, pero todavía no se descargan y su licencia aún no se ha publicado.
Novedad — Modelos
Emiratos lanza tres modelos para el árabe que se habla de verdad
El instituto TII de Abu Dabi presentó el 6 de octubre tres modelos centrados en el árabe emiratí y en otros idiomas poco atendidos. Falcon-Emirati (7.000 millones de parámetros) entiende el dialecto de la calle, sus refranes y su poesía: saca un 84,83% en Alyah, una prueba propia de árabe emiratí, por delante de cualquier modelo abierto evaluado. Falcon-ASR (1.600 millones) pasa a texto el habla en árabe, inglés, francés, español y portugués, y hasta marca en qué momento se dice cada palabra. Falcon-OCR-Arabic extrae texto y tablas de imágenes y documentos. La idea de fondo: el árabe culto no es lo mismo que el árabe del día a día.
Novedad — General
Un estudio mide cuánto se alinean los modelos chinos con el gobierno
La empresa europea Aleph Alpha ha probado 967 temas sensibles (Tiananmen, Taiwán, Xinjiang) en modelos de Qwen, DeepSeek y Kimi: solo entre el 17% y el 41% de las respuestas salen equilibradas; el resto repite la doctrina oficial o se niega a contestar. Lo más llamativo: el modelo Nemotron Cascade 2, de Nvidia, también muestra ese sesgo en un 17% de las preguntas, al parecer por datos de entrenamiento generados con DeepSeek y Qwen. Ojo: el estudio lo firma un competidor que vende «IA soberana».
MCP — Datos e IA
fal MCP (oficial) — Más de 1.000 modelos para dibujar y crear
El servidor MCP oficial de fal.ai: conectas tu IA a una URL y le das tu clave, y desde ahí puede buscar y ejecutar más de 1.000 modelos (Flux, SDXL, y modelos de vídeo, audio y 3D). La IA elige el modelo adecuado sola y lo lanza, con precios a la vista antes de gastar.
Modelo — Imagen
Qwen-Image (Alibaba) — Modelo de imagen abierto, fuerte con texto
Qwen-Image es el modelo de imagen de Alibaba (la familia Qwen, que en el catálogo aparece para texto). Es abierto (se puede descargar) y de los mejores escribiendo texto dentro de la imagen (carteles, rótulos). También edita imágenes. Su versión actual es Qwen-Image-2.1 (7B, de pesos abiertos).
Novedad — Modelos
Gemini gratis se queda con un solo modelo el 9 de octubre
Desde el 9 de octubre, quien use Gemini sin pagar solo tendrá el modelo pequeño (Flash-Lite): Flash y Pro desaparecen del plan gratis. Los que pagan AI Plus (4,99 $ al mes) pierden Pro, que pasa a necesitar AI Pro (19,99 $) o AI Ultra. Para el uso de andar por casa (resumir, ideas, dudas cortas) no cambia mucho; para analizar documentos largos o código difícil, sí.
Novedad — Modelos
Alibaba añade GLM-5.3 y DeepSeek-V4-Pro a su nube de modelos
La plataforma Qwen de Alibaba Cloud ha metido en su catálogo dos modelos chinos de primera línea: GLM-5.3 (de Zhipu) y DeepSeek-V4-Pro, ya con API pública y planes de pago por tokens. Los dos están afinados para programar y para agentes que encadenan varios pasos.
Novedad — Cerebros
H Company abre Holo4, modelos para agentes que usan el ordenador
El 28-sep-2026, H Company publicó Holo4, una familia de modelos abiertos (pesos en Hugging Face) para que los agentes manejen solos la pantalla y el ordenador (lo que se llama computer use). Vienen en dos tamaños (27B y 35B) y mejoran en entornos que usan MCP.
Novedad — Cerebros
NVIDIA lanza Kumo Tabular, un modelo abierto para datos de tablas
El 29-sep-2026 NVIDIA publicó Kumo Tabular, un modelo abierto (en Hugging Face) que predice valores en tablas (como las de Excel) sin entrenar ni ajustar nada. Viene en tres tamaños (28 M a 215 M de parámetros) y queda primero en cuatro pruebas comparativas.
Modelo — Texto y razonamiento
gpt-oss (OpenAI) — Los modelos abiertos de OpenAI
gpt-oss son los modelos abiertos de OpenAI: sí, la casa de ChatGPT también regala pesos. Vienen en dos tamaños (20B y 120B), con 256K de contexto y razonamiento (niveles bajo/medio/alto). Son equilibrados, gratis y Apache 2.0. Ideal si quieres la "filosofía" de OpenAI pero en tu PC y sin pagar.
MCP — Diseño y Frontend
mcpimg — Dibujar con muchos modelos desde un solo conector
Un conector de imagen multi-proveedor: con una sola herramienta puedes generar con openRouter, Together, Replicate o fal.ai, según la clave que tengas. Funciona en OpenCode, Claude Code y Cursor. Su punto débil: es un proyecto pequeño y sin licencia declarada.
Novedad — Cerebros
Google lanza Gemini 4 Argon, su modelo frontera (de momento solo para ciberdefensa)
El 30-sep-2026 Google anunció Gemini 4 Argon, su modelo más potente hasta la fecha, pensado para tareas largas y complejas. Eso sí: no lo puedes usar todavía. Primero se está dando solo a equipos de ciberdefensa (programa Fairwind) y más adelante llegará al público. Precio de entrada: 2 $ / 10 $ por millón de tokens.
Novedad — Cerebros
Xiaomi abre MiMo-V2.6 — lo más alto en modelos abiertos
Xiaomi publicó el 22 de septiembre de 2026 su serie MiMo-V2.6 (Pro y Flash) con pesos abiertos (MIT). Es omnimodal (texto, imagen, audio y vídeo) y llegó a lo más alto del ranking de modelos abiertos.
Programa — Redes y datos
ScrapeGraphAI — Sacar datos de webs diciéndole qué quieres (sin programar el extractor)
Una librería gratuita y de código abierto (para Python) que saca datos de páginas web sin que le indiques dónde está cada cosa: le describes qué información quieres y una IA la busca y te la devuelve ordenada. Sirve para listas de precios, contactos públicos o seguimiento de webs. Pide saber algo de Python y la IA que lee las páginas la pagas tú (o usas un modelo local).
Novedad — Modelos
OpenBMB sube MiniCPM-V 4.7 sin ficha, sin licencia y sin pruebas
El laboratorio chino OpenBMB publicó la noche del 6 de octubre un modelo de visión y lenguaje de 35.000 millones de parámetros (35B-A3B) en Hugging Face, y lo hizo sin tarjeta de modelo, sin licencia y sin ninguna tabla de resultados. Solo hay 16 trozos de pesos, 70,4 GB. La configuración sí cuenta lo importante: mezcla de expertos derivada de Qwen3.5, 256 expertos de los que activa 8 por palabra, contexto de 256.000 tokens y una atención híbrida que combina tres capas lineales por cada una completa. Al no declarar licencia, el repositorio queda por defecto con todos los derechos reservados, así que conviene esperar antes de construir sobre él.
Novedad — Modelos
Kandinsky 6.0 genera el vídeo y su sonido en la misma pasada
Kandinsky Lab sacó el 6 de octubre Kandinsky 6.0 Video, una familia de modelos de pesos abiertos que crea la imagen y el audio a la vez, en lugar de pegarle una banda sonora después. Hay dos tamaños, Pro (29.000 millones de parámetros) y Lite (3.000), y los dos hacen clips de 5 segundos a 24 imágenes por segundo con sonido sincronizado a 44 kHz, incluida la sincronización de labios. Un modelo aparte amplía el resultado hasta Full HD. Los pesos están en Hugging Face y ComfyUI estrenó ese mismo día su extensión, con dos plantillas listas para usar.
Novedad — Cerebros
Google retira Imagen — ahora su modelo de imagen es Nano Banana
Google apagó Imagen (su antiguo generador de imágenes) el 17 de agosto de 2026. Su modelo de imagen actual es Nano Banana (Gemini Image), que además de generar, entiende y edita imágenes conversando.
Skill — Datos e IA
Probabl Data Science Skills
Skills oficiales de Probabl (el equipo detrás del ecosistema scikit-learn) para que tu IA haga ciencia de datos y machine learning con buen método: construir el pipeline, explorar los datos, evaluar resultados, guardarlos para auditarlos e iterar. Pensado para que la IA no "haga trampa" al medir sus modelos.
MCP — Email
Resend MCP (oficial) — Envía emails desde tu web
Conector oficial de Resend, el servicio de email transaccional que usan muchas webs modernas: el que envía los correos automáticos de tu web (confirmación de registro, recuperar contraseña, avisos). Le permite a tu IA enviar y gestionar emails y contactos. Es el hueco de "enviar correos" que faltaba. Con plan gratis, oficial y con OAuth.
Programa — Programación y código
ForgeCode — programar por parejas en la terminal, con tres modos
Un agente de terminal con tres formas de usarlo: conversación normal, una orden suelta que se ejecuta y se va, o como complemento de tu terminal. Funciona con más de 300 modelos.
Modelo — Texto y razonamiento
Doubao / Seed (ByteDance) — Barato y a lo grande
Doubao (la app) y Seed (los modelos) son de ByteDance, la dueña de TikTok. Su familia Seed 2.x es frontera y muy barata: compite con GPT/Gemini en muchas pruebas a una fracción del precio, y es multimodal (texto, imagen, voz, vídeo). Es cerrado. Ideal si quieres calidad a precio de saldo (y no te importa que sea chino).
Modelo — Texto y razonamiento
GLM (Zhipu AI) — El abierto que pelea con la frontera
GLM, de Zhipu AI (marca internacional Z.ai), es uno de los mejores modelos abiertos del mundo. Su versión actual, GLM-5.x (hasta 5.3), roza la frontera cerrada y cuesta una fracción. Es abierto (pesos públicos), barato y muy bueno en código y agentes. Ideal si quieres mucho por poco y poder autoalojarlo.
Novedad — General
Aleph Alpha lanza Kolibri, la IA europea que no depende de EE.UU. ni de China
La alemana Aleph Alpha ha presentado Kolibri, un modelo de IA de 78.000 millones de parámetros, con licencia abierta y entrenado solo en infraestructura de Alemania y Finlandia, bajo ley europea. Está pensado para administraciones y empresas que necesitan controlar dónde se procesan sus datos sin depender de proveedores de fuera.
Novedad — General
DeepSeek V4.1 Flash: visión, contexto enorme y al frente de su API
DeepSeek (China) ha lanzado V4.1 Flash, un modelo ligero y de pesos abiertos que entiende imágenes, admite hasta un millón de tokens de contexto y cuesta bastante menos que los grandes de EE.UU. La empresa lo ha puesto al frente de su servicio para programadores y jubila su V4 Pro, porque este rinde mejor y sale más económico.
Skill — Escritura y contenido
avoid-ai-writing — Quitar el "look IA" a un Texto
La herramienta de referencia para quitarle a un texto los "tics" de la IA (frases hechas, guiones largos raros, palabras pomposas...). Detecta los patrones, reescribe el texto y verifica que sigue diciendo lo mismo, con tres modos (reescribir, solo detectar, editar en el sitio) y perfiles de voz.
Skill — Escritura y contenido
Claude Blog — Escritura de Blog con SEO y Control de Calidad
Un sistema completo para escribir blogs con calidad garantizada: genera el artículo, lo optimiza para Google y para que la IA lo cite, y no te lo entrega hasta que pasa un "contrato de calidad" de 5 puertas (mínimo 90 sobre 100). 32 skills, 30 comandos, multiidioma y refresco de contenido viejo.