top of page

Meta випустила Muse Glimmer — агентну модель для локального запуску

Meta випустила Muse Glimmer

Meta Superintelligence Labs (MSL) представила Muse Glimmer — агентну модель на 30 млрд параметрів — і відкрила її ваги за ліцензією Apache 2.0. Про це компанія повідомила в дописі дослідницького блогу Meta AI Research.



Muse Glimmer: 30 млрд параметрів і open source ліцензія Apache 2.0


Модель розрахована на постійні локальні агентні сценарії. За даними компанії, вона запускається на Mac або PC з однією GPU. MSL називає чотири базові сценарії застосування: локальні агенти, function calling, локальне написання коду та оцінювання за схемою LLM-as-a-judge. Ключова відмінність від хмарних розгортань — робота без підключення до інтернету.


Ваги моделі вже доступні для завантаження на Hugging Face разом із документацією для розробників. Компанія також анонсувала оптимізовані інтеграції з llama.cpp, MLX і ExecuTorch «найближчими днями». Реліз «розширює відкриті дослідження Meta на агентний AI». Оцінку моделі перед відкритим релізом компанія проводила за власним документом Advanced AI Scaling Framework.



Як Meta навчала модель: дистиляція від Muse Spark і навчання з підкріпленням


Навчання відбувалося у три етапи. На етапі pre-training модель тренували на виходах більшої моделі Muse Spark методом logit distillation із подібним набором даних.


На етапі mid-training компанія використала дані з довшим контекстом і насиченими агентними сценаріями. Фінальний етап поєднав кероване донавчання, дистиляцію на власних відповідях моделі та навчання з підкріпленням (RL).


За даними MSL, у навчальну вибірку увійшли дані понад 100 мов. Мультимодальний ввід забезпечує окремий енкодер сприйняття (perception encoder). Модель обробляє скриншоти, графіки та документи разом із текстом діалогу.


Компанія оцінювала Muse Glimmer на бенчмарках DeepSearch QA, MCP-Atlas, τ-Bench і SWE-Bench. За наведеними Meta даними, модель показує сильні результати у своєму класі порівняно з Gemma4-31B та Qwen3.6-27B; незалежної верифікації цих цифр допис не містить.



Квантизація і прискорене декодування: до 20 ГБ пам'яті і прискорення у 3,1 раза


Найконкретніші цифри стосуються локальної оптимізації. У повній точності модель на 30 млрд параметрів потребувала б понад 55 ГБ пам'яті — більше, ніж дає будь-яка споживча GPU.


Meta застосувала квантизацію ваг приблизно до 4-бітної точності. Це зменшило мовну модель до менш ніж 20 ГБ і залишило запас для KV cache, perception encoder та допоміжної моделі в межах 24 ГБ або 32 ГБ.


Друга оптимізація — прискорене декодування із легкою моделлю на основі DFlash. Вона пропонує цілі блоки токенів, а основна модель перевіряє їх паралельно.


За вимірами компанії, приріст швидкості генерації становить 3,1 раза на NVIDIA RTX 5090, 1,8 раза на MacBook M5 Max і 1,5 раза на M4 Max. Meta стверджує, що стиснення дає мінімальну деградацію якості на агентних завданнях.


Банер тг-канал High Bar Journa

© 2035 by Business Name. Made with Wix Studio™

bottom of page