Meta stellt Muse Glimmer 30B vor: Neues LLM für lokale KI-Agenten
Veröffentlicht am 10.08.2026
Meta bringt mit Muse Glimmer 30B ein neues KI-Modell an den Start, das nicht primär für den klassischen Chatbot gedacht ist. Stattdessen wurde das Modell gezielt für lokale KI-Agenten entwickelt, die über längere Zeit selbstständig Aufgaben bearbeiten, Programme und andere Werkzeuge aufrufen, Bilder analysieren und nach Fehlern weiterarbeiten können.
Das Entscheidende dabei: Muse Glimmer soll nicht zwingend in einem Rechenzentrum laufen. Meta hat das Modell gezielt so optimiert, dass es auf leistungsfähigen PCs und Macs betrieben werden kann – vollständig lokal und damit auf Wunsch auch ohne Internetverbindung. Die Modellgewichte stehen unter der vergleichsweise freizügigen Apache-2.0-Lizenz zur Verfügung.
Damit trifft Meta einen derzeit besonders interessanten Bereich der KI-Entwicklung: leistungsfähige Agentenmodelle auf dem eigenen Rechner.
Ein 30-Milliarden-Modell speziell für KI-Agenten
Muse Glimmer besitzt rund 29,6 Milliarden Parameter und basiert auf einer dichten Transformer-Architektur. Zusätzlich verfügt das Modell über einen eigenen Perception Encoder für die Verarbeitung von Bildern.
Dadurch kann Muse Glimmer nicht nur Text verstehen, sondern beispielsweise auch Screenshots, Diagramme, Dokumente und andere Bilder in seine Arbeit einbeziehen. Die Ausgabe erfolgt derzeit als Text. Hinzu kommt ein Kontextfenster von mehr als 131.000 Token, womit auch umfangreichere Dokumente oder längere Agenten-Sitzungen verarbeitet werden können. Trainiert wurde das Modell laut Meta mit Daten aus mehr als 100 Sprachen.
Die eigentliche Besonderheit liegt jedoch weniger in der reinen Modellgröße als in der Ausrichtung.
Muse Glimmer wurde darauf trainiert, längere Aufgabenketten abzuarbeiten. Ein Agent kann beispielsweise zunächst Informationen sammeln, anschließend ein Tool aufrufen, dessen Ergebnis überprüfen und danach den nächsten Arbeitsschritt planen.
Schlägt ein Tool-Aufruf fehl oder liefert ein unerwartetes Ergebnis, soll das Modell den Fehler erkennen und einen neuen Versuch starten, anstatt die gesamte Aufgabe einfach abzubrechen. Meta nennt unter anderem Multi-Step Reasoning, Function Calling, Failure Recovery und Long-Horizon Task Execution als zentrale Fähigkeiten.
Das Modell ist außerdem ausdrücklich für Agenten-Frameworks beziehungsweise sogenannte Scaffolds vorgesehen. In der Model Card werden unter anderem OpenClaw und Hermes Agent genannt.
Unter 20 GB statt mehr als 55 GB
Ein 30-Milliarden-Parameter-Modell ist allerdings nicht gerade klein. In voller Präzision würde Muse Glimmer laut Meta mehr als 55 GB Speicher benötigen.
Deshalb setzt Meta stark auf Quantisierung.
Die Gewichte lassen sich auf ungefähr vier Bit reduzieren, wodurch das Sprachmodell auf unter 20 GB schrumpft. Meta bietet unter anderem eine rund 17 GB große Variante an, die für Systeme mit etwa 24 GB Grafikspeicher vorgesehen ist.
Dabei muss zusätzlich Platz für den KV-Cache, den Bild-Encoder und weitere Komponenten bleiben. Laut Metas eigenen Messungen liegt die durchschnittliche Qualitätsabweichung der 17-GB-Variante über 15 untersuchte Benchmarks bei etwa einem Prozent. Eine für 32 GB Speicher vorgesehene Variante lag in diesen Messungen noch näher am Modell in voller Präzision.
Damit ist Muse Glimmer zwar noch immer kein Modell für einen beliebigen Office-PC mit acht Gigabyte Arbeitsspeicher. Für High-End-Grafikkarten, leistungsfähige Workstations und Rechner mit viel Unified Memory bewegt sich ein Modell dieser Größe inzwischen aber in einem durchaus praktikablen Bereich.
| Full Precision | K-Quant-Dynamic | K-Quant-17GB | |
|---|---|---|---|
| % Degradation* | – | 0.2% | 1.0% |
| Target Hardware | 64GB VRAM | 32GB VRAM | 24GB VRAM |
DFlash soll die lokale KI deutlich beschleunigen
Meta hat Muse Glimmer außerdem mit einer Technik ausgestattet, die insbesondere bei längeren Agenten-Aufgaben interessant werden könnte: Speculative Decoding mit DFlash.
Normalerweise erzeugt ein Sprachmodell seine Ausgabe Token für Token. DFlash verwendet dagegen ein kleineres zusätzliches Modell, das gleich ganze Blöcke möglicher Token vorschlägt. Das große Modell überprüft diese Vorschläge anschließend parallel.
Der DFlash-Drafter von Muse Glimmer arbeitet dabei mit Blöcken von jeweils 16 Token.
In Metas eigenen Benchmarks war der Effekt teilweise erheblich. Auf einer Nvidia GeForce RTX 5090 stieg die durchschnittliche Geschwindigkeit in den getesteten Prompts von 74,9 auf 233,4 Token pro Sekunde – rund das 3,1-Fache.
Auf einem Apple M5 Max erhöhte sich die gemessene Geschwindigkeit von 26,6 auf 50,2 Token pro Sekunde, beim M4 Max von 23,7 auf 37,8 Token pro Sekunde. Die Werte stammen allerdings aus Metas eigenen Messungen mit Batch-Größe 1 und Greedy Decoding und sollten daher nicht als universelle Leistungswerte für jede Anwendung verstanden werden.
Gerade für KI-Agenten ist die Technik interessant. Ein Agent erzeugt häufig deutlich mehr Token als ein normaler Chatbot, weil er planen, Tool-Aufrufe formulieren und Ergebnisse auswerten muss. Eine höhere Decoding-Geschwindigkeit kann hier einen erheblichen Unterschied machen.
Auch AMD zeigt erste Ergebnisse
Parallel zur Veröffentlichung hat AMD erste Messwerte für Muse Glimmer auf eigener Hardware veröffentlicht.
Auf einem Ryzen AI Max+ 395 wurden demnach unter Windows mit llama.cpp und Vulkan bis zu rund 24 Token pro Sekunde erreicht. Eine einzelne Radeon AI PRO R9700 mit 32 GB Speicher kam mit aktiviertem DFlash auf bis zu rund 53 Token pro Sekunde.
AMD bezeichnet die Ergebnisse ausdrücklich als vorläufig und erwartet weitere Verbesserungen durch Software- und Modelloptimierungen.
Interessant ist dabei vor allem, dass Muse Glimmer nicht an ein bestimmtes Hardware-Ökosystem gebunden werden soll. Meta nennt neben AMD auch Apple-, Nvidia-, Intel- und Arm-Plattformen beziehungsweise entsprechende Software-Frameworks.
Ollama, LM Studio und Hugging Face
Für den Erfolg eines lokalen KI-Modells ist inzwischen mindestens genauso wichtig, wie einfach es installiert werden kann.
Die Originalgewichte von Muse Glimmer stehen über Hugging Face zur Verfügung. Dort veröffentlicht Meta neben dem Modell auch die quantisierten Varianten, den DFlash-Drafter und den eigenen Perception Encoder.
Auch Ollama hat Muse Glimmer bereits in seine Modellbibliothek aufgenommen. Zum Zeitpunkt der veröffentlichten Informationen war zunächst eine rund 21 GB große MLX-Version für Apple Silicon mit 128K-Kontext verfügbar. Unterstützung für Nvidia-, AMD- und weitere Plattformen sollte folgen.
LM Studio griff die Veröffentlichung ebenfalls auf. Über entsprechende lokale Server-Schnittstellen lässt sich ein Modell wie Muse Glimmer zudem über OpenAI- beziehungsweise Anthropic-kompatible APIs mit anderen Programmen und Agenten verbinden. AMD beschreibt beispielsweise die Kombination mit Hermes Agent oder OpenClaw.
Damit könnte Muse Glimmer vergleichsweise schnell Bestandteil bestehender lokaler KI-Umgebungen werden, ohne dass Entwickler zunächst eine komplette eigene Inferenz-Infrastruktur aufbauen müssen.
Bei Agenten-Benchmarks teilweise sehr stark
Auch die von Meta veröffentlichten Benchmark-Ergebnisse zeigen deutlich, worauf das Modell optimiert wurde.
Beim MCP Atlas Benchmark erreicht Muse Glimmer beispielsweise einen Wert von 75,5. Das von Meta zum Vergleich angeführte Gemma4-31B kommt auf 54,2 und Qwen3.6-27B auf 62,5.
Bei DeepSearch QA erreicht Muse Glimmer 74,6 und beim SWE-Bench Pro 51,2.
Muse Glimmer gewinnt allerdings keineswegs jeden Vergleich. Bei SWE-Bench Verified, TerminalBench oder OSWorld-Verified liegt Qwen3.6-27B in Metas Tabelle beispielsweise vorne.
Das macht die Ergebnisse eigentlich interessanter: Muse Glimmer scheint weniger als universelles Benchmark-Modell positioniert zu sein, sondern als Modell, dessen Stärken gezielt bei Agenten-Aufgaben, Tool-Nutzung und langen Arbeitsabläufen liegen.
| Benchmark |
Muse Glimmer-30B
High Reasoning
|
Gemma4-31B
Thinking Mode
|
Qwen3.6-27B
Thinking Mode
|
|
|---|---|---|---|---|
|
General Agentic
|
MCP Atlas | 75.5 | 54.2 | 62.5 |
| DeepSearch QA | 74.6 | 61.7 | 71.1 | |
| τ3-Banking | 23.5 | 15.1 | 16.7 | |
| WildClawBench | 47.6 | 37.6 | 43.2 | |
| GDPval-AA | 953 | 811 | 1141 | |
| GAIA2 | 43.3 | 36.4 | 40.0 | |
|
SkillsBench
With Skills
|
44.3 | 32.4 | 46.6 | |
| OSWorld-Verified | 65.9 | 58.5 | 75.6 | |
|
Agentic Coding
|
SWE-Bench Pro | 51.2 | 36.9 | 50.2 |
| SWE-Bench Verified | 76.0 | 66.6 | 77.2 | |
| TerminalBench 2.1 | 51.7 | 43.4 | 60.7 | |
| SciCode | 43.6 | 43.4 | 39.8 | |
|
Multimodal
|
Charxiv Reasoning | 78.8 | 77.7 | 78.4 |
| ScreenSpot Pro | 75.4 | 75.9 | 76.1 | |
| OmniDocBench v1.5 | 75.8 | 72.5 | 77.8 | |
| MMMU Pro | 74 | 73 | 75 | |
|
Safety
|
CI Memories |
Violation (↓): 26.4
Coverage: 64.8
|
Violation (↓): 12.1
Coverage: 53.0
|
Violation (↓): 53.4
Coverage: 66.9
|
| Siren AgentDojo |
Attack Success Rate (↓): 28.4
Utility: 94.2
|
Attack Success Rate (↓): 25.6
Utility: 90.8
|
Attack Success Rate (↓): 40.3
Utility: 92.7
|
|
|
General Capabilities and Reasoning
|
IFBench | 77.0 | 76.0 | 70.8 |
| AIME 2026 | 94.7 | 89.2 | 94.1 | |
| GPQA Diamond | 83.5 | 85.7 | 84.2 | |
|
Humanity’s Last Exam
Text · No Tools
|
22.0 | 23.6 | 23.1 | |
| AA-LCR | 80.0 | 68.3 | 73.3 | |
| Beam 128K | 65.1 | 58.2 | 63.0 |
Warum lokale KI-Agenten interessant werden
Der wohl spannendste Punkt an Muse Glimmer ist deshalb nicht ein einzelner Benchmarkwert.
Bisher werden leistungsfähige KI-Agenten häufig über Cloud-Modelle betrieben. Das ist komfortabel, bringt bei dauerhaften Agenten allerdings einige Nachteile mit sich. Jede Aktion kann neue API-Kosten verursachen, die Daten müssen unter Umständen den eigenen Rechner verlassen und ohne Internetverbindung steht der Agent möglicherweise nicht mehr zur Verfügung.
Bei einem lokalen Modell verändert sich dieses Konzept.
Ein persönlicher KI-Agent könnte beispielsweise Dateien durchsuchen, Dokumente auswerten, Programme bedienen oder lokale Entwicklerwerkzeuge verwenden, während sensible Arbeitsdaten auf dem eigenen Rechner bleiben.
Gerade bei einem dauerhaft aktiven Agenten ist das ein wichtiger Unterschied. Ein solcher Assistent benötigt möglicherweise Zugriff auf wesentlich mehr persönliche Informationen als ein Chatbot, dem gelegentlich eine einzelne Frage gestellt wird.
Allerdings bedeutet lokale Ausführung nicht automatisch Sicherheit. Meta weist selbst darauf hin, Muse Glimmer nicht einfach ungeschützt mit beliebigen Werkzeugen zu verbinden. Insbesondere bei Aktionen mit realen Konsequenzen empfiehlt das Unternehmen zusätzliche Schutzmechanismen und beispielsweise eine menschliche Bestätigung vor irreversiblen Aktionen.
Ein interessantes Signal für die nächste Generation lokaler KI
Muse Glimmer 30B zeigt ziemlich deutlich, in welche Richtung sich lokale KI entwickeln könnte.
Statt immer größere Modelle lediglich als Chatbot auf dem eigenen Rechner nachzubauen, werden Modelle zunehmend für konkrete lokale Agenten-Workflows optimiert: lange Kontexte, Tool-Nutzung, Bildverständnis, Fehlerbehandlung und hohe Geschwindigkeit bei längeren Aufgaben.
Mit rund 30 Milliarden Parametern ist Muse Glimmer dabei groß genug, um anspruchsvollere Aufgaben zu übernehmen, gleichzeitig aber durch Quantisierung klein genug, um auf aktueller High-End-Consumer-Hardware eingesetzt zu werden.
Besonders interessant dürfte nun werden, wie gut sich das Modell außerhalb von Metas Benchmarks in realen Agenten-Umgebungen wie OpenClaw, Hermes Agent, LM Studio oder Ollama schlägt.
Sollten lokale Modelle dieser Größenklasse zuverlässig längere Aufgaben selbstständig bearbeiten können, könnte sich ein Teil der heutigen KI-Agenten langfristig tatsächlich von der Cloud auf den eigenen PC verlagern.
Quellen
- Introducing Muse Glimmer: An Open Agentic Model That Runs on Your Device – Meta AI Research
- Muse Glimmer / LM Studio – LM Studio auf X
- Muse Glimmer – Ollama
- Muse-Glimmer-30B Model Card – Hugging Face / Meta
- Run Meta Muse Glimmer 30B on AMD Ryzen AI Max and Radeon GPUs – AMD