GLM-5.3: Z.ai macht sein KI-Modell deutlich stärker beim Coding – und überraschend gut bei Cybersecurity
Veröffentlicht am 14.08.2026
Z.ai hat mit GLM-5.3 eine neue Version seines KI-Modells vorgestellt. Bemerkenswert ist dabei weniger ein komplett neues Fundament als vielmehr die Methode, mit der die Verbesserungen erzielt wurden: GLM-5.3 verwendet laut Z.ai dasselbe Basismodell wie GLM-5.2. Sämtliche Leistungssteigerungen sollen aus einem umfangreicheren Post-Training stammen.
Das Ergebnis ist vor allem bei komplexen Programmieraufgaben deutlich sichtbar. Gleichzeitig hat sich während des Trainings eine Fähigkeit stärker entwickelt als vom Hersteller erwartet: GLM-5.3 ist erheblich besser darin geworden, Sicherheitslücken zu finden und komplexe Exploit-Ketten nachzuvollziehen.
Kein neues Basismodell – aber deutlich stärkeres Post-Training
Z.ai verfolgt bei GLM-5.3 einen interessanten Ansatz. Statt ein größeres oder grundsätzlich neues Basismodell zu trainieren, wurde die bereits mit GLM-5.2 aufgebaute Trainingsinfrastruktur weiter skaliert.
Dazu gehören unter anderem mehr Trainingsumgebungen, vielfältigere Aufgaben und zusätzliche Rechenleistung für Reinforcement Learning. Die Aufgaben sollen dabei zunehmend weniger wie klassische Coding-Benchmarks aussehen und stärker tatsächlicher Entwicklungsarbeit entsprechen.
Ein Beispiel: Das Modell bekommt eine Arbeitsumgebung, wie sie auch ein Entwickler vorfinden könnte – mit Zugriff auf Code-Repositories, Dokumentation, Speicher, Compute-Cluster und Experimentergebnisse. Anschließend muss die KI selbstständig Engpässe identifizieren, Änderungen am Code umsetzen, Experimente durchführen und überprüfen, ob die Optimierung tatsächlich funktioniert.
Einige dieser Aufgaben würden laut Z.ai für einen erfahrenen Entwickler mehrere Tage Arbeit bedeuten.
Damit verschiebt sich auch das Ziel des Trainings. GLM-5.3 soll nicht lediglich einzelne Coding-Aufgaben lösen, sondern größere Projekte über längere Zeit selbstständig bearbeiten können.
Große Sprünge bei Coding-Benchmarks
Die Fortschritte gegenüber GLM-5.2 fallen teilweise erheblich aus.
Beim anspruchsvollen Terminal Bench 3.0 steigt GLM beispielsweise von 4,6 auf 28,3 Punkte. Bei DeepSWE v1.1 verbessert sich das Modell von 46,2 auf 66,9 Punkte.
Auch bei länger laufenden Software-Aufgaben zeigt sich ein deutlicher Sprung. Im SWE-Marathon v1.1 steigt das Ergebnis von 19,4 auf 42,5 Punkte, während GLM-5.3 beim FrontierSWE-Benchmark 78,1 erreicht.
Z.ai spricht deshalb von seinem bislang leistungsfähigsten Modell für komplexe Programmieraufgaben.
Allerdings ist GLM-5.3 nicht automatisch in jedem Benchmark das stärkste Modell. Je nach Test liegen beispielsweise Kimi K3, DeepSeek-V4 Pro oder geschlossene Modelle weiterhin vorne.
Interessant ist vielmehr das Gesamtbild: Die Verbesserungen betreffen zahlreiche unterschiedliche Coding- und Agenten-Benchmarks gleichzeitig.
Mehr Leistung mit weniger Tokens
Besonders interessant für praktische Coding-Agenten ist ein weiterer Punkt: GLM-5.3 soll nicht nur bessere Ergebnisse liefern, sondern dafür teilweise weniger Output-Tokens benötigen.
Im internen Z.ai Code Bench erreicht GLM-5.3 bei maximalem Reasoning-Aufwand beispielsweise eine Genauigkeit von rund 34,5 Prozent bei etwa 75.000 Output-Tokens pro Aufgabe.
GLM-5.2 kam dagegen auf ungefähr 23,4 Prozent und benötigte dafür rund 96.000 Tokens.
Auch gegenüber einigen geschlossenen Modellen sieht Z.ai Vorteile. Beim hohen Reasoning-Level erreicht GLM-5.3 laut Hersteller 31,4 Prozent bei ungefähr 50.000 Tokens. Claude Opus 4.8 erreicht in derselben Darstellung 29,5 Prozent bei rund 120.000 Tokens.
An der Spitze liegt GLM-5.3 in diesem internen Vergleich allerdings nicht: Claude Fable 5 erreicht beim maximalen Aufwand 39,5 Prozent.
Gerade weil es sich bei Z.ai Code Bench um einen nicht öffentlichen, unternehmenseigenen Benchmark handelt, sollten solche Zahlen allerdings mit entsprechender Vorsicht betrachtet werden. Sie zeigen vor allem, welche Fortschritte Z.ai innerhalb seiner eigenen Testumgebung misst.
Überraschende Entwicklung: GLM-5.3 wird zum Cybersecurity-Modell
Der vielleicht spannendste Teil der Veröffentlichung betrifft jedoch nicht das Programmieren, sondern Cybersecurity.
Z.ai hatte gezielt Daten und Trainingsumgebungen zur Suche nach Sicherheitslücken in das Post-Training aufgenommen. Erwartet wurde dadurch eine bessere Erkennung und Analyse einzelner Schwachstellen.
Nach Angaben des Unternehmens entwickelte sich die Fähigkeit allerdings schneller und weiter als erwartet.
GLM-5.3 soll zunehmend in der Lage sein, nicht nur einzelne Fehler im Code zu identifizieren, sondern mehrstufige Angriffsketten zu verstehen und vollständige Exploit-Strategien zu entwickeln.
Diese Entwicklung bezeichnet Z.ai selbst als „Emergent Cyber Capability“.
84,5 Prozent bei CyberGym
Bei CyberGym erreicht GLM-5.3 laut Z.ai einen Wert von 84,5 Prozent. GLM-5.2 kam auf 77,2 Prozent.
CyberGym untersucht, ob ein Modell Sicherheitslücken anhand des Quellcodes entdecken und anschließend praktisch validieren kann.
Noch deutlicher fällt der Unterschied bei anspruchsvolleren Exploit-Aufgaben aus.
Bei ExploitBench steigt GLM-5.3 von lediglich 24,4 auf 54,4 Prozent. Damit hat sich die Leistung gegenüber GLM-5.2 mehr als verdoppelt.
Geschlossene Frontier-Modelle liegen hier allerdings weiterhin deutlich vorne. In der von Z.ai veröffentlichten Gegenüberstellung erreichen Mythos 5 beispielsweise 78,0 Prozent und GPT-5.6 Sol 76,5 Prozent.
Ein ähnliches Bild zeigt sich bei ExploitGym. GLM-5.3 schafft dort laut Hersteller 105 Aufgaben innerhalb des normalisierten Zwei-Stunden-Budgets und 130 Aufgaben innerhalb von sechs Stunden. Bei GLM-5.2 waren es lediglich 29 beziehungsweise 39 Aufgaben.
Z.ai weist selbst auf ein interessantes Muster hin: Je weiter sich ein Benchmark entlang einer tatsächlichen Exploit-Kette bewegt, desto stärker hat sich GLM-5.3 gegenüber seinem Vorgänger verbessert – gleichzeitig wächst dort aber weiterhin der Abstand zu den leistungsfähigsten geschlossenen Modellen.
Tausende Sicherheitslücken in echten Projekten gefunden
Die Cybersecurity-Fähigkeiten wurden laut Z.ai nicht nur in Benchmarks getestet.
Gemeinsam mit mehreren Sicherheitsteams in China ließ das Unternehmen seine Modelle auch auf reale Codebasen los. Nach manueller Überprüfung, Filterung und Entfernung von Duplikaten sollen dabei 2.436 Sicherheitslücken in 269 Projekten identifiziert worden sein.
Die auf Seite 6 des Berichts dargestellte Übersicht führt davon 107 als kritisch und 990 als hoch eingestuft auf – insgesamt also 1.097 kritische oder hochgefährliche Schwachstellen. Weitere 1.286 werden als „Medium“ und 53 als „Low“ kategorisiert.
Betroffen waren unter anderem Betriebssysteme, Kernel, Browser-Engines, Open-Source-Infrastruktur, Webanwendungen und Netzwerkprotokolle.
Besonders bemerkenswert: Einige dieser Schwachstellen sollen bereits seit Jahrzehnten im jeweiligen Code vorhanden gewesen sein. Die älteste im Bericht aufgeführte Sicherheitslücke geht auf 1981 zurück.
Z.ai hat dafür ein eigenes Security Disclosure Ledger aufgebaut. Darüber sollen bestätigte Schwachstellen kontrolliert an die jeweiligen Projekte gemeldet und nach ihrer Veröffentlichung dokumentiert werden.
Zum Zeitpunkt des Berichts waren von den 2.436 erfassten Findings erst 53 öffentlich offengelegt, während sich 2.383 noch im Disclosure-Prozess beziehungsweise unter Embargo befanden.
Das eigentliche Geheimnis von GLM-5.3: bessere Trainingsumgebungen
Technisch ist GLM-5.3 auch deshalb interessant, weil Z.ai damit zeigen möchte, wie wichtig die Qualität der Trainingsumgebung für moderne KI-Agenten wird.
Das Unternehmen erzeugt inzwischen einen Teil dieser Umgebungen automatisiert. Forschungsagenten sammeln typische Aufgaben aus realen Arbeitsprozessen und verwandeln sie in ausführbare Szenarien mit mehreren Arbeitsschritten.
Ein zusätzlicher „Judge Agent“ überprüft anschließend, ob eine Aufgabe tatsächlich lösbar ist.
Damit versucht Z.ai eines der grundlegenden Probleme beim Reinforcement Learning für KI-Agenten zu lösen: Je leistungsfähiger die Modelle werden, desto schwieriger wird es, ausreichend anspruchsvolle und gleichzeitig zuverlässig bewertbare Trainingsaufgaben zu erzeugen.
Die eigentliche Skalierung findet deshalb zunehmend nicht nur beim Modell, sondern bei den Aufgaben, Simulationen, Testumgebungen und automatisierten Prüfsystemen statt.
Mehr als doppelte Trainingsgeschwindigkeit
Auch die technische Infrastruktur wurde weiter optimiert.
GLM-5.3 wird mit dem Open-Source-Post-Training-Framework slime trainiert. Dabei kommen Megatron für das Training und SGLang für die Modell-Rollouts zum Einsatz.
Durch Verbesserungen beim Scheduling, bei der Lastverteilung, beim Caching sowie bei der Verteilung von Prefill- und Decode-Ressourcen konnte Z.ai nach eigenen Angaben den End-to-End-Durchsatz beim Reinforcement Learning für lang laufende Coding-Aufgaben um mehr als den Faktor 2,3 steigern.
Das wiederum ermöglicht längere Trainingsläufe und komplexere Aufgaben, ohne dass die benötigte Rechenleistung im gleichen Verhältnis steigen muss.
GLM-5.3 denkt immer
Mit GLM-5.3 gibt es gleichzeitig eine wichtige Änderung für Entwickler.
Das sogenannte „Thinking“ kann nicht mehr vollständig deaktiviert werden. Das Modell unterstützt stattdessen drei Reasoning-Stufen:
Low, High und Max.
Für Coding-Aufgaben empfiehlt Z.ai die Einstellung „Max“.
Anwendungen, die bisher bei GLM-5.2 thinking.type: disabled verwenden, müssen deshalb angepasst werden. Andernfalls schlägt eine Anfrage an GLM-5.3 fehl. Für eine möglichst ressourcenschonende Migration empfiehlt Z.ai, Thinking zu aktivieren und zunächst reasoning_effort: low zu verwenden.
Neues Punktesystem und günstigere Off-Peak-Nutzung
Auch beim GLM Coding Plan gibt es Änderungen.
Z.ai führt ein punktebasiertes Quotensystem ein. Input-Tokens, zwischengespeicherte Input-Tokens und Output-Tokens werden dabei separat berechnet.
Interessant ist vor allem ein zeitabhängiger Faktor: Außerhalb der Peak-Zeit kosten Modellaufrufe nur 50 Prozent der regulären Punkte.
Als Peak-Zeitraum definiert Z.ai Montag bis Freitag zwischen 14 und 18 Uhr chinesischer Zeit (UTC+8). Abende, Nächte und Wochenenden fallen entsprechend in den günstigeren Zeitraum.
Für Nutzer des Coding Plans dürfte das insbesondere bei längeren automatisierten Agenten-Aufgaben interessant sein.
Die Modellgewichte sollen folgen
GLM-5.3 wird von Z.ai bereits als Open-Weights-Modell positioniert. Die Gewichte wurden zum Veröffentlichungszeitpunkt allerdings noch nicht unmittelbar bereitgestellt.
Laut Z.ai sollen sie rund zwei Wochen nach der Vorstellung von GLM-5.3 veröffentlicht werden. Bis dahin sollen weitere Sicherheitsprüfungen und Hardening-Maßnahmen durchgeführt werden.
Gerade angesichts der stark gestiegenen Fähigkeiten im Bereich Exploit-Entwicklung erscheint diese zusätzliche Sicherheitsphase nachvollziehbar.
Fazit
GLM-5.3 ist vor allem deshalb interessant, weil Z.ai für den Leistungssprung kein neues Basismodell benötigt hat. Stattdessen zeigt die Veröffentlichung, wie viel Potenzial inzwischen im Post-Training, in Reinforcement Learning und in realistischeren Agenten-Umgebungen steckt.
Beim Coding verbessert sich GLM-5.3 teilweise drastisch gegenüber GLM-5.2 und kann bei mehreren Benchmarks mit aktuellen Spitzenmodellen konkurrieren. Gleichzeitig scheint das Modell effizienter mit seinen Tokens umzugehen und zunehmend längere Aufgaben eigenständig bearbeiten zu können.
Noch spannender ist allerdings die Entwicklung im Bereich Cybersecurity. Dass sich die Fähigkeiten zur Schwachstellenanalyse und Exploit-Entwicklung beim Hochskalieren des Trainings derart stark verbessern, dürfte nicht nur für Z.ai interessant sein.
Es zeigt zugleich eine Herausforderung der kommenden Modellgenerationen: Je besser KI-Systeme beim Programmieren und beim autonomen Arbeiten werden, desto stärker werden zwangsläufig auch ihre Fähigkeiten bei der Analyse – und potenziell der Ausnutzung – von Sicherheitslücken.
GLM-5.3 liefert dafür ein bemerkenswertes Beispiel.
Quellen
- GLM-5.3 – Z.ai