Meta vuelve a los pesos abiertos: Muse Glimmer, 30B parámetros en 17 GB y con licencia Apache 2.0
Meta Superintelligence Labs liberó el 10 de agosto Muse Glimmer, su primer modelo abierto desde Llama 4: 30B parámetros, multimodal, comprimido a 17 GB para correr en una GPU de 24 GB y bajo Apache 2.0. Cuatro días después, Alibaba liberó Qwen3.8-27B, que según su propia ficha lo supera en Terminal Bench, SWE-bench Pro y OSWorld.
Meta volvió a liberar un modelo de IA y lo hizo con una licencia más permisiva que la de cualquier Llama. Muse Glimmer, de 30 mil millones de parámetros, salió el 10 de agosto bajo Apache 2.0 y está diseñado para correr como agente en tu propia computadora, sin nube.
Es el primer modelo de lenguaje abierto de Meta desde Llama 4. Tras ese tropiezo, la empresa reorganizó su área de IA en Meta Superintelligence Labs y lanzó Muse Spark, un modelo cerrado (Forbes, 11 de agosto). Glimmer es un destilado (modelo chico entrenado para imitar a uno grande) de Muse Spark. Llama tenía licencia propia con tope de usuarios; Apache 2.0 no trae esas condiciones.
Parámetros
30B
Denso, con codificador de imágenes de 1.8B
Peso K-Quant-17GB
17 GB
Más de 55 GB a precisión completa
Contexto
131,072 tokens
Texto e imágenes de entrada
Velocidad con DFlash
3.1x
RTX 5090: de 74.9 a 233.4 tokens/s (ficha en Hugging Face)
| Muse Glimmer-30B (Meta) | Qwen3.8-27B (Alibaba) | |
|---|---|---|
| Lanzamiento | 10 ago 2026 | 14 ago 2026 |
| Licencia | Apache 2.0 | Apache 2.0 |
| Contexto | 131,072 tokens | 262,144 tokens |
| Terminal Bench 2.1 | 51.7 | 73.0 |
| SWE-bench Pro | 51.2 | 61.7 |
| OSWorld-Verified | 65.9 | 84.3 |
| GPQA Diamond | 83.5 | 89.2 |
Qué cabe en una GPU de 24 GB
Según Meta, a precisión completa el modelo necesita más de 55 GB de memoria. La versión K-Quant-17GB (pesos comprimidos a unos 4 bits) pesa 17 GB y cabe en una GPU de 24 GB o en una Mac, con espacio para el caché y el codificador de imágenes; hay otra variante, K-Quant-Dynamic, para 32 GB. Meta reporta una degradación de 1.0% en promedio sobre 15 benchmarks. Es multimodal (texto e imágenes) y la ficha en Hugging Face marca 131,072 tokens de contexto.
Con DFlash (decodificación especulativa: un modelo chico propone bloques de texto y el grande los verifica) genera 3.1x más rápido en una RTX 5090 (de 74.9 a 233.4 tokens por segundo), 1.8x en M5 Max y 1.5x en M4 Max, según Meta. Está entrenado para agentes: llamar herramientas, sostener planes largos y reintentar cuando una herramienta falla. El mismo día apareció en Ollama; Meta lista también llama.cpp, MLX, LM Studio, vLLM y SGLang.
Frente a Qwen
Meta compara a Glimmer con Gemma4-31B y Qwen3.6-27B. En su tabla (10 de agosto) gana en MCP Atlas (75.5 contra 62.5) y SWE-Bench Pro (51.2 contra 50.2), pero pierde en OSWorld-Verified (65.9 contra 75.6) y TerminalBench 2.1 (51.7 contra 60.7).
Cuatro días después, el 14 de agosto, Alibaba liberó Qwen3.8-27B, también Apache 2.0. Su ficha en Hugging Face reporta 73.0 en Terminal Bench 2.1 y 84.3 en OSWorld-Verified, contra 51.7 y 65.9 de Glimmer. Artificial Analysis (17 de agosto) le da a Qwen3.8-27B 52 puntos en su Intelligence Index, empatado con GPT-5.6 Luna de OpenAI.
Lo que sigue: Alexandr Wang, jefe de Superintelligence Labs, prometió pesos abiertos de una versión de Muse Spark 1.2 "pronto".
Comentarios
Sé la primera persona en comentar.


