GLM-5.3-Flash: Z.ai will Spitzenleistung zu einem Bruchteil der Kosten liefern
Veröffentlicht am 26.08.2026
Z.ai stellt mit GLM-5.3-Flash ein nativ multimodales Modell vor, das laut Anbieter die Leistung von GLM-5.2 deutlich übertrifft und in mehreren Coding- und Agenten-Benchmarks in die Nähe von Claude Opus 4.8 kommt. Möglich machen sollen das eine neue Hybrid-Architektur aus linearer und sparsamer Attention, nur 18 Milliarden aktive Parameter und ein auf Effizienz optimierter Serving-Stack.
Mit GLM-5.3-Flash stellt Z.ai ein neues KI-Modell vor, bei dem nicht allein die maximale Modellgröße im Mittelpunkt steht. Stattdessen setzt das Unternehmen auf ein Verhältnis aus hoher Leistungsfähigkeit, multimodalen Funktionen und möglichst niedrigen Inferenzkosten. Der neue Vertreter der GLM-5-Familie verfügt über insgesamt 320 Milliarden Parameter, aktiviert pro Verarbeitungsschritt aber lediglich 18 Milliarden davon.
Damit verfolgt Z.ai einen Ansatz, der sich zunehmend im KI-Markt durchsetzt: Nicht die Zahl der vorhandenen Parameter entscheidet allein über die praktische Leistungsfähigkeit eines Modells, sondern vor allem darüber, wie effizient diese beim Betrieb genutzt werden.
Nach Angaben des Herstellers soll GLM-5.3-Flash seinen Vorgänger GLM-5.2 in zahlreichen Benchmarks deutlich übertreffen und bei anspruchsvollen Coding- und Agentenaufgaben teilweise an deutlich teurere Spitzenmodelle heranreichen. Gleichzeitig wurde die Architektur gezielt auf niedrige Betriebskosten und lange Kontexte optimiert.
Vom geheimen „ox-alpha“ zum populären Modell
Bereits vor der offiziellen Vorstellung ließ Z.ai das Modell anonym unter dem Namen „ox-alpha“ auf OpenCode und OpenRouter testen. Dadurch wollte das Unternehmen Feedback aus realen Nutzungsszenarien sammeln, ohne dass der bekannte Modellname die Wahrnehmung beeinflusst.
Der Test entwickelte sich offenbar schnell zu einem Erfolg. Laut den im Dokument gezeigten Nutzungsstatistiken wurde ox-alpha zeitweise zum meistgenutzten Modell auf OpenRouter. Auch innerhalb von OpenCode erreichte es eine hohe Nutzung.
Bemerkenswert ist dabei noch ein anderer Punkt: Z.ai zufolge wurde der gesamte Traffic während dieser Phase auf chinesischen KI-Chips verarbeitet. Damit dient GLM-5.3-Flash nicht nur als Demonstration eines neuen Modells, sondern gleichzeitig als Beispiel dafür, dass leistungsfähige KI-Inferenz inzwischen auch auf alternativer Hardware-Infrastruktur in großem Maßstab betrieben werden kann.
Hohe Benchmark-Leistung bei niedrigen Kosten
Ein zentrales Verkaufsargument von GLM-5.3-Flash ist das Preis-Leistungs-Verhältnis. Im Artificial Analysis Intelligence Index v4.1.1 erreicht das Modell laut Z.ai einen Wert von 57 Punkten bei Kosten von 0,045 US-Dollar pro Aufgabe im rabattierten Tarif.
Nach Darstellung des Unternehmens entspricht das einem Leistungsniveau, das bislang ungefähr zehnmal höhere Kosten verursacht habe.
Gerade für Entwickler und Unternehmen könnte dieser Punkt wichtiger sein als einige zusätzliche Benchmark-Punkte. Denn bei dauerhaft eingesetzten KI-Agenten, Coding-Assistenten oder automatisierten Workflows summieren sich Token- und Inferenzkosten schnell. Ein Modell, das nahe an die Leistung der teuersten Systeme herankommt, dabei aber wesentlich günstiger betrieben werden kann, könnte deshalb für viele Anwendungen zur interessanteren Standardoption werden.
Allerdings stammen die dargestellten Benchmark- und Kostenvergleiche überwiegend von Z.ai beziehungsweise aus den vom Unternehmen verwendeten Evaluierungen. Sie sollten daher zunächst als Herstellerangaben betrachtet werden.
Besonders stark bei Coding und Agenten
Die größten Leistungssteigerungen gegenüber GLM-5.2 zeigt Z.ai im Bereich Coding und Agentic AI.
Auf DeepSWE v1.1 erreicht GLM-5.3-Flash beispielsweise 63,4 Punkte, während GLM-5.2 auf 46,2 kommt. Beim AutomationBench steigt der Wert von 26,2 auf 48,8 Punkte. Auch bei Toolathlon Verified liegt GLM-5.3-Flash mit 78,4 Punkten vor dem Vorgänger und laut Tabelle sogar vor Claude Opus 4.8 mit 76,2 Punkten.
Beim Terminal Bench 2.1 erreicht das Modell 84,3 Punkte und liegt damit knapp unter den 85,0 Punkten von Opus 4.8. In anderen Tests bleibt Claude wiederum vorne. Ein einheitlicher Sieger über sämtliche Benchmarks hinweg ergibt sich deshalb nicht.
Interessant ist vor allem das Gesamtbild: GLM-5.3-Flash soll nicht nur einzelne Aufgaben gut lösen, sondern Coding, Tool-Nutzung und längere agentische Abläufe miteinander verbinden.
Das zeigt sich auch in einem internen Z.ai-Code-Benchmark. Bei maximalem Rechenaufwand erreicht GLM-5.3-Flash dort einen Wert von 29,0 gegenüber 29,5 für Claude Opus 4.8.
320 Milliarden Parameter – aber nur 18 Milliarden gleichzeitig aktiv
Der technische Schlüssel zur Effizienz liegt in der Architektur.
GLM-5.3-Flash besitzt zwar insgesamt 320 Milliarden Parameter, aktiviert davon während der Inferenz jedoch nur 18 Milliarden. Zum Vergleich: Die ältere GLM-4.5-Serie kommt laut Z.ai bei insgesamt 355 Milliarden Parametern auf 32 Milliarden aktive Parameter.
Auch bei der Anzahl der Schichten wurde deutlich reduziert. GLM-5.3-Flash arbeitet mit 45 Layern, während GLM-4.5 noch 92 verwendet.
Damit versucht Z.ai, weniger Rechenoperationen pro generiertem Token zu benötigen, ohne die Leistungsfähigkeit entsprechend stark zu reduzieren.
Eine weitere Neuerung ist eine Hybrid-Architektur aus linearer und sparsamer Attention. Lineare Attention soll lokale Zusammenhänge effizient erfassen, während Sparse Attention gezielt Informationen aus dem globalen Kontext auswählt.
Gerade bei sehr langen Eingaben ist das relevant. Klassische Attention-Mechanismen können mit wachsender Kontextlänge enorme Mengen an Speicher und Rechenleistung beanspruchen.
Millionen-Token-Kontext soll günstiger werden
Z.ai optimiert GLM-5.3-Flash ausdrücklich für sehr lange Kontexte. Im Dokument werden Szenarien mit bis zu einer Million Tokens beschrieben.
Dabei kommt unter anderem eine Technik namens „IndexPool“ zum Einsatz. Sie komprimiert jeweils vier Schlüssel-Vektoren des Indexers zu einem gemeinsamen Vektor. Dadurch sollen Speicherbedarf und Verzögerungen insbesondere bei extrem langen Kontexten sinken.
Im Vergleich zum größeren GLM-5.3 benötigt GLM-5.3-Flash nach Angaben des Herstellers rund dreimal weniger Rechenaufwand für Attention. Gleichzeitig fällt der KV-Cache pro Layer rund 4,4-mal kleiner aus.
Gerade der KV-Cache ist bei großen Sprachmodellen ein wichtiger Kostenfaktor. Während ein Modell längere Gespräche, Dokumente oder Codebasen verarbeitet, müssen zahlreiche Zwischeninformationen im Speicher gehalten werden. Ein kleinerer Cache ermöglicht deshalb nicht nur günstigere Infrastruktur, sondern kann auch höhere Nutzerzahlen pro Server ermöglichen.
Z.ai räumt allerdings selbst ein, dass Modelle wie Kimi-K3 und DeepSeek-V4-Flash beim KV-Cache teilweise noch sparsamer arbeiten.
Multimodalität ist erstmals fest in der GLM-5-Serie verankert
GLM-5.3-Flash ist nach Angaben von Z.ai das erste von Beginn an multimodal ausgelegte Modell der GLM-5-Serie.
Trainiert wurde es mit einem multimodalen Pretraining-Korpus von rund 30 Billionen Tokens. Text und Code sind damit nur ein Teil des Trainingsmaterials. Das Modell soll auch visuelle Informationen verstehen und direkt in seine Arbeitsabläufe einbeziehen können.
Das ist vor allem für Coding-Agenten interessant.
Bei der Entwicklung einer Webseite reicht es beispielsweise nicht aus, dass der erzeugte HTML-, CSS- oder JavaScript-Code technisch funktioniert. Das Ergebnis muss anschließend auch korrekt aussehen. Ähnliches gilt für Spiele, 3D-Simulationen, Präsentationen oder grafische Benutzeroberflächen.
GLM-5.3-Flash soll deshalb seine eigenen Ergebnisse rendern, visuell betrachten, Fehler erkennen und anschließend den zugrunde liegenden Code oder das Dokument überarbeiten können.
Z.ai spricht hierbei von einem geschlossenen Kreislauf zwischen Generierung und visuellem Feedback.
KI prüft ihre eigenen Präsentationen
Im Dokument demonstriert Z.ai diesen Ansatz anhand einer Präsentationsfolie. Das Modell erstellt zunächst eine Version mit Layout-Problemen, betrachtet anschließend das Ergebnis visuell und korrigiert die Komposition.
Das Beispiel mag auf den ersten Blick weniger spektakulär wirken als ein Coding-Benchmark. Für die praktische Nutzung von KI könnte genau diese Fähigkeit jedoch wichtig werden.
Bislang können viele Modelle zwar hervorragend Texte, Code oder Präsentationsinhalte erzeugen. Ob das Endergebnis visuell überzeugend ist, müssen Nutzer häufig selbst kontrollieren.
Ein multimodales Modell kann dagegen theoretisch nicht nur sagen, wie eine Präsentation aussehen sollte, sondern das tatsächliche Ergebnis betrachten und bewerten.
Damit erweitert sich der mögliche Einsatzbereich deutlich über reine Programmierung hinaus.
Dokumente, Tabellen und Dashboards als Arbeitsumgebung
Z.ai positioniert GLM-5.3-Flash deshalb ausdrücklich auch als Modell für Wissensarbeit.
Im Büroalltag liegen Informationen schließlich selten nur als reiner Text vor. Sie verteilen sich auf Dokumente, Tabellen, Präsentationen, Dashboards, Benutzeroberflächen oder Besprechungsunterlagen.
Ein multimodales Modell kann solche Informationen gemeinsam analysieren und muss nicht darauf warten, dass Nutzer jedes Diagramm oder jede Oberfläche zunächst ausführlich in Textform beschreiben.
In OfficeQA Pro erreicht GLM-5.3-Flash laut Z.ai 62,4 Punkte. DeepSeek-V4-Vision-Exp kommt in der Vergleichstabelle auf 57,9 und Claude Opus 4.8 auf 48,9 Punkte.
Auch bei mehreren visuellen Benchmarks wie BabyVision, MVBench und MMVU weist Z.ai höhere Werte als die aufgeführten Vergleichsmodelle aus.
Chinesische KI-Chips übernehmen die Inferenz
Neben dem Modell selbst widmet Z.ai einen großen Teil der Vorstellung der zugrunde liegenden Infrastruktur.
GLM-5.3-Flash wurde demnach bereits über einen größeren Cluster chinesischer KI-Beschleuniger betrieben. Da einzelne Chips im Vergleich zu etablierten High-End-GPUs teilweise stärker durch Speichergröße und Speicherbandbreite eingeschränkt sind, entwickelte das Unternehmen einen eigenen Inferenz-Stack auf Basis von SGLang.
Zum Einsatz kommen unter anderem Quantisierungstechniken wie W8A8 sowie hybride INT8-, FP8- und BF16-Caches. Außerdem trennt eine sogenannte Encode-Prefill-Decode-Architektur verschiedene Phasen der Modellverarbeitung in unabhängig skalierbare Worker-Pools.
Das Ergebnis soll erheblich höhere Effizienz sein. Gegenüber einer ersten Implementierung auf derselben Hardware habe Z.ai die End-to-End-Serving-Leistung um den Faktor drei steigern können.
Nach Unternehmensangaben liegen Hardware-Effizienz und Kosten pro Token inzwischen auf einem ähnlichen Niveau wie bei gängigen NVIDIA-GPUs.
Interessantes Detail: Bei der Optimierung der Infrastruktur kam wiederum ein GLM-5.3-basierter Agent zum Einsatz. Die KI half den Entwicklern unter anderem bei Kernel-Optimierung und Fehlersuche. Das Modell unterstützte damit gewissermaßen die Entwicklung jener Infrastruktur, auf der Modelle seiner eigenen Familie anschließend betrieben werden.
GLM-5.3-Flash ist auch als offenes Modell verfügbar
GLM-5.3-Flash wird nicht ausschließlich über Z.ai angeboten. Die Modellgewichte wurden laut Anbieter auch öffentlich auf Hugging Face bereitgestellt.
Für lokale beziehungsweise eigene Deployments werden derzeit unter anderem SGLang, vLLM und TokenSpeed unterstützt.
Nutzer des GLM Coding Plans erhalten ebenfalls Zugriff. Z.ai verspricht für GLM-5.3-Flash dort die dreifache nutzbare Quote gegenüber GLM-5.3.
Damit dürfte das Modell sowohl für Entwickler interessant sein, die einfach eine API beziehungsweise einen Coding-Agenten verwenden möchten, als auch für Unternehmen und Forschungsteams, die Modelle auf eigener Infrastruktur betreiben wollen.
Effizienz wird zum eigentlichen Wettbewerb
GLM-5.3-Flash zeigt eine Entwicklung, die für die nächste Phase des KI-Wettbewerbs entscheidend werden könnte. Nachdem sich die Branche lange vor allem auf immer größere Modelle konzentriert hat, rückt zunehmend die Frage in den Mittelpunkt, wie viel praktische Intelligenz sich mit einem bestimmten Budget tatsächlich bereitstellen lässt.
Genau hier will Z.ai punkten.
320 Milliarden Gesamtparameter klingen weiterhin gewaltig. Entscheidend ist aber, dass während der Verarbeitung nur ein kleiner Teil davon aktiviert wird, während neue Attention-Verfahren, Quantisierung und eine speziell abgestimmte Infrastruktur zusätzlich Kosten sparen sollen.
Sollten sich die vom Hersteller präsentierten Ergebnisse auch in unabhängigen Tests bestätigen, wäre GLM-5.3-Flash deshalb weniger wegen eines einzelnen Rekordwerts interessant. Bedeutender wäre die Kombination aus starker Coding-Leistung, agentischen Fähigkeiten, nativer Multimodalität, langen Kontexten und vergleichsweise günstiger Inferenz.
Der Kampf um die leistungsfähigste KI wird damit zunehmend auch zu einem Kampf um Effizienz. Und GLM-5.3-Flash ist ein weiteres deutliches Zeichen dafür, dass Spitzenmodelle künftig nicht nur intelligenter, sondern vor allem wirtschaftlicher werden müssen.
Quellen
- GLM-5.3-Flash – Z.ai