Meta Muse Glimmer działa w trybie offline na jednym procesorze graficznym (GPU), ale wymaga 24 GB pamięci VRAM

10 sierpnia firma Meta udostępniła Muse Glimmer – model językowy zawierający około 30 miliardów parametrów. To, co przykuwa uwagę, to nie tyle sam model, co licencja i urządzenie docelowe. Wagi modelu są udostępnione na platformie Hugging Face na licencji Apache 2.0, dzięki czemu można je pobrać, modyfikować i wykorzystywać w celach komercyjnych. Model ten nie został zaprojektowany do działania w centrum danych, lecz na pojedynczej karcie graficznej pod Państwa biurkiem.
Model pochodzi z laboratorium Meta Superintelligence Lab i jest uproszczeniem większego modelu Muse Spark, co oznacza, że duży model nauczył mniejszy, jak udzielać odpowiedzi. Jako dane wejściowe przyjmuje tekst i obrazy, ale generuje wyłącznie tekst, obsługuje ponad 100 języków i działa w oknie kontekstowym obejmującym ponad 131 000 tokenów. Jego wiedza kończy się na dniu 4 stycznia 2026 r. Najnowszymi produktami firmy Meta są agent Muse Code oraz generator obrazów Muse Image.
Minimalne wymagania to 24 GB pamięci VRAM
Przy pełnej precyzji model wymagałby 64 GB pamięci graficznej. Meta kompresuje ją do około 4 bitów poprzez kwantyzację – mniej precyzyjną metodę przechowywania liczb, która zajmuje znacznie mniej miejsca. Dzięki temu część językowa zmniejsza się do poniżej 20 GB, co pozostawia miejsce na koder obrazu oraz pamięć podręczną dla toczącej się rozmowy.
W zestawie znajdują się dwa gotowe warianty. K-Quant-Dynamic jest dostosowany do 32 GB i traci średnio 0,2 procent dokładności w 15 testach porównawczych, natomiast K-Quant-17GB mieści się w 24 GB i traci 1,0 procent. W praktyce oznacza to, że wymagana jest karta GeForce RTX 5090, RTX 4090, RTX 3090 lub komputer Mac z procesorem M4 Max. Karta klasy średniej o pojemności 12 GB nie spełnia wymagań. Jeśli dysponują Państwo mniejszą ilością pamięci, w naszym przewodniku omówiono mniejsze modele przeznaczone do laptopów, a nawet iPhone obsługuje obecnie użyteczny model językowy.
Jeden akcelerator zapewnia trzykrotny wzrost szybkości
Aby zapobiec spowolnieniu działania modelu lokalnego, firma Meta dostarcza narzędzie pomocnicze o nazwie DFlash. Generuje ono 16 tokenów jednocześnie, a duży model sprawdza cały blok w jednym przebiegu i koryguje jedynie te elementy, które są nieprawidłowe. Według własnych pomiarów firmy Meta przepustowość na karcie RTX 5090 wzrasta z 74,9 do 233,4 tokenów na sekundę, co stanowi wzrost o współczynnik 3,1. W przypadku MacBooka z procesorem M5 Max wydajność wzrasta z 26,6 do 50,2 tokenów, a w przypadku M4 Max – z 23,7 do 37,8.
Tego samego dnia firma AMD opublikowała własne wyniki. Mini PC z procesorem Ryzen AI Max+ 395 osiąga do 24 tokenów na sekundę, a karta graficzna Radeon AI PRO R9700 – do 53, co zmierzono w systemie Windows przy użyciu programu llama.cpp. Firma AMD określa te wyniki jako wstępne.
Silne strony w planowaniu, słabsze w interfejsie
Meta porównuje model Muse Glimmer z modelami Gemma4-31B firmy Google oraz Qwen3.6-27B firmy Alibaba. Gdy model wywołuje narzędzia i planuje działania w kilku etapach, wyraźnie prowadzi. W teście MCP Atlas uzyskał wynik 75,5 w porównaniu z 54,2 i 62,5, a w teście DeepSearch QA – 74,6 w porównaniu z 61,7 i 71,1.
W pozostałych obszarach wygrywa Qwen. W zakresie obsługi rzeczywistego interfejsu pulpitu wynik wynosi 65,9 do 75,6, a w terminalu – 51,7 do 60,7. W teście bezpieczeństwa Siren AgentDojo, który mierzy, jak łatwo model można zmanipulować za pomocą instrukcji ukrytych w dokumentach zewnętrznych, wskaźnik skuteczności ataków modelu Muse Glimmer wynoszący 28,4% przewyższa wynik Qwen, ale pozostaje w tyle za modelem Gemma4, który osiągnął 25,6%. Warto o tym pamiętać, zanim zastosuje Pan/Pani ten model do analizy własnych plików i poczty elektronicznej.
Jak uzyskać dostęp
Na platformie Hugging Face dostępne są cztery pakiety: model bazowy z pełnymi wagami BF16, pliki GGUF dla llama.cpp, kompilacje ExecuTorch dla urządzeń Apple oraz narzędzie pomocnicze DFlash. Najłatwiejszym sposobem jest skorzystanie z LM Studio, gdzie model pojawia się w wynikach wyszukiwania. Firma AMD zaleca w tym celu co najmniej 32 GB pamięci graficznej lub równoważną alokację pamięci systemowej. Jeśli dysponują Państwo mniejszą ilością pamięci, dostawcy tacy jak Unsloth oferują mniejsze kwantyzacje, jednak wówczas konieczne jest przeniesienie części modelu do zwykłej pamięci systemowej, co wiąże się z zauważalnym spadkiem wydajności. Społeczność zareagowała błyskawicznie. Niecały dzień po premierze dostępnych było już 57 dodatkowych kwantyzacji oraz sześć wariantów dostrojonych. Wypróbowanie modelu w przeglądarce, tak jak miało to miejsce w przypadku Kimi K3, nie wchodzi tutaj w grę. Bez odpowiedniego sprzętu Muse Glimmer pozostaje poza zasięgiem.






