xAI stellt Grok 4.6 vor: Neues KI-Modell für Agenten, Coding und komplexe Projekte
Veröffentlicht am 12.08.2026
xAI hat mit Grok 4.6 die nächste Version seiner Grok-Modellreihe vorgestellt. Das neue KI-Modell baut auf Grok 4.5 auf und soll vor allem dort Fortschritte bringen, wo künstliche Intelligenz nicht nur eine einzelne Frage beantworten, sondern über viele Arbeitsschritte hinweg selbstständig an einer komplexen Aufgabe arbeiten muss.
Damit richtet xAI den Fokus bei Grok 4.6 deutlich auf sogenannte KI-Agenten, Softwareentwicklung sowie anspruchsvolle interaktive und visuelle Projekte. Das Modell ist seit dem 12. August 2026 unter anderem über die xAI-API, Grok Build und Cursor verfügbar.
Grok 4.6 soll länger an komplexen Aufgaben arbeiten können
Eine der wichtigsten Neuerungen betrifft sogenannte Long-Running Agents. Gemeint sind KI-Systeme, die eine Aufgabe nicht nach wenigen Antworten abschließen, sondern über längere Zeit verschiedene Schritte planen und ausführen.
Ein solcher Agent könnte beispielsweise zunächst Informationen recherchieren, anschließend Daten auswerten, Dateien oder Quellcode untersuchen und daraus schließlich eine Anwendung oder einen Bericht erstellen. Entscheidend ist dabei, dass das Modell während dieses längeren Prozesses den Zusammenhang nicht verliert und auf vorherigen Arbeitsschritten aufbauen kann.
Genau hier möchte xAI Grok 4.6 verbessert haben. Das Modell soll komplexe Aufgaben über zahlreiche Schritte hinweg verfolgen können – beispielsweise bei Recherche, Wissensarbeit, Softwareentwicklung oder der Erstellung vollständiger Anwendungen.
Besonders interessant ist dabei eine weitere Beobachtung von xAI: Bei längeren Arbeitsabläufen soll Grok 4.6 häufiger damit beginnen, eigene Ergebnisse zu überprüfen und zu testen, bevor es mit dem nächsten Arbeitsschritt fortfährt. Eine solche Selbstkontrolle ist für autonome KI-Agenten wichtig, da sich kleine Fehler ansonsten über viele aufeinanderfolgende Schritte hinweg fortsetzen können.
Von der Idee bis zur funktionierenden Anwendung
xAI hebt außerdem die Fähigkeiten von Grok 4.6 bei der Entwicklung interaktiver Projekte hervor.
Das Modell soll aus einer relativ allgemeinen Produktidee bereits einen umfangreichen ersten Entwurf erstellen können. Dazu kann Grok beispielsweise zunächst ein unbekanntes Themengebiet recherchieren, anschließend die Struktur einer Anwendung planen, zentrale Funktionen implementieren und das Ergebnis danach auf Basis weiterer Rückmeldungen überarbeiten.
Auch bei der visuellen Gestaltung soll Grok 4.6 gegenüber Grok 4.5 Fortschritte machen. Laut xAI liefert das Modell bei Web-Anwendungen und interaktiven Projekten bereits im ersten Durchlauf häufiger eine brauchbare Struktur und eine konsistente visuelle Gestaltung.
Damit folgt xAI einem Trend, der bei aktuellen KI-Modellen immer wichtiger wird: Statt lediglich Text oder einzelne Codefragmente zu erzeugen, sollen Modelle zunehmend komplette Arbeitsabläufe übernehmen und konkrete Ergebnisse produzieren.
So wurde Grok 4.6 trainiert
Auch beim Training hat xAI nach eigenen Angaben nachgelegt.
Grok 4.6 erhielt zunächst eine längere zusätzliche Trainingsphase als sein Vorgänger Grok 4.5. Dabei kamen unter anderem kuratierte, von Modellen erzeugte Trainingsdaten für logisches Denken und technische Themen sowie hochwertige Daten aus der Softwareentwicklung zum Einsatz. Zusätzlich wurden Optimierungsverfahren und das Trainingsverfahren selbst überarbeitet.
Anschließend nutzte xAI Grok 4.5, um neue Trainingsverläufe für verschiedene Bereiche zu erzeugen. Dazu gehörten unter anderem Mathematik und Naturwissenschaften, Softwareentwicklung sowie allgemeine Wissensarbeit.
Darauf folgte Reinforcement Learning in unterschiedlichen agentischen Umgebungen. Trainiert wurde das Modell unter anderem für allgemeines Coding, Kernel-Optimierung, Webentwicklung und Computer-Aided Design (CAD).
Der Ansatz zeigt, dass xAI Grok 4.6 nicht ausschließlich auf klassische Frage-Antwort-Benchmarks optimiert hat. Ein wesentlicher Teil des Trainings konzentriert sich offenbar darauf, Aufgaben in realistischeren Arbeitsumgebungen selbstständig zu bearbeiten.
Grok 4.6 erreicht starke Ergebnisse in Agenten- und Coding-Benchmarks
Passend dazu legt xAI bei der Vorstellung von Grok 4.6 besonderen Wert auf Benchmarks für Softwareentwicklung, Agenten und Wissensarbeit.
Im Artificial Analysis Intelligence Index erreicht Grok 4.6 laut den von xAI veröffentlichten Ergebnissen einen Wert von 61 Punkten. Damit liegt das Modell in der dargestellten Auswertung gleichauf mit GPT-5.6 Sol Max, während Fable 5 Max auf 62 Punkte kommt.
| Grok 4.6 High | Grok 4.5 High | GPT-5.6 Sol Max | Fable 5 Max | |
|---|---|---|---|---|
| AA Intelligence Index | 61 | 56 | 61 | 62 |
| GDPVal-AA v2 | 1753 | 1526 | 1728 | 1741 |
| CursorBench v3.2 | 69.9% | 66.7% | 67.2% | 70.5% |
| DeepSWE v1.1 | 65.9% | 54% | 73% | 70% |
| FrontierCode v1.1 (Extended) | 61.3% | 56.6% | 60.6% | 63.6% |
| APEX-Agents | 57.5% | 47.1% | 56.7% | 59.2% |
| Terminal-Bench v3.0 | 26% | 15.7% | 34.6% | 34.1% |
| APEX-SWE | 56.4% | 53.6% | — | 58.8% |
| AA-Briefcase | 1577 | 1313 | 1502 | 1574 |
| Harvey LAB (Vals) | 15.8% | 12.9% | 2.5% | 11.3% |
Beim Wissensarbeits-Benchmark GDPVal-AA v2 erzielt Grok 4.6 einen Wert von 1753 und liegt damit in der von xAI veröffentlichten Tabelle vor den dort aufgeführten Vergleichsmodellen. Auch bei FrontierCode v1.1 Extended und APEX-Agents kann sich Grok 4.6 gegenüber Grok 4.5 deutlich verbessern.
Allerdings liegt das neue Modell nicht in allen Tests an der Spitze. Beim DeepSWE v1.1, bei CursorBench v3.2 und insbesondere bei Terminal-Bench v3.0 erreichen einzelne Konkurrenzmodelle höhere Ergebnisse. Die veröffentlichten Zahlen zeigen daher kein durchgehend überlegenes Modell, sondern ein insgesamt deutlich stärker gewordenes Grok mit besonderen Stärken bei agentischen Aufgaben und Wissensarbeit.
Bei der Einordnung sollte zudem berücksichtigt werden, dass die Benchmark-Zusammenstellung von xAI selbst veröffentlicht wurde. Nach Angaben des Unternehmens stammen die Werte konkurrierender Modelle aus deren veröffentlichten System Cards beziehungsweise öffentlichen Benchmark-Ergebnissen.
Grok 4.6 startet in API, Cursor und Grok Build
Grok 4.6 ist direkt zum Start über mehrere Plattformen verfügbar. Dazu gehören Grok Build, Cursor sowie die xAI-API. Darüber hinaus nennt xAI unter anderem OpenRouter, Vercel und Cloudflare als weitere Anbieter beziehungsweise Partner, über die das Modell genutzt werden kann.
Für Entwickler beginnt der API-Preis laut xAI bei 2 US-Dollar pro einer Million Input-Tokens und 6 US-Dollar pro einer Million Output-Tokens. Zusätzlich wird eine schnellere Variante angeboten, deren Preis doppelt so hoch liegt.
Für die erste Woche nach Veröffentlichung bietet xAI zudem in Grok Build und Cursor das Doppelte der normalerweise enthaltenen Nutzung für Grok 4.6 an.
Auch Sicherheitsmechanismen wurden angepasst
Mit zunehmenden Fähigkeiten autonom arbeitender KI-Agenten wächst gleichzeitig die Bedeutung von Sicherheitsmechanismen. Ein leistungsfähiger Coding-Agent kann schließlich nicht nur Programme schreiben, sondern theoretisch auch Sicherheitslücken analysieren oder andere technisch sensible Aufgaben bearbeiten.
xAI gibt an, die Schutzmechanismen von Grok 4.6 an die erweiterten Fähigkeiten des Modells angepasst zu haben. Für die neue Version sei die bislang umfangreichste Vorab-Evaluierung des Unternehmens durchgeführt worden. Zusätzlich sollen Tests nach der Veröffentlichung sowie externe Prüfungen erfolgen.
Ziel sei es laut xAI, legitime Anwendungsfälle wie das Beheben von Sicherheitslücken, technische Entwicklungsarbeiten oder KI-Forschung möglichst wenig einzuschränken und gleichzeitig missbräuchliche Nutzung zu begrenzen.
Fazit: Grok entwickelt sich zunehmend zum KI-Agenten
Mit Grok 4.6 setzt xAI die Entwicklung weg vom reinen Chatbot und hin zu einem universelleren KI-Arbeitssystem fort.
Die interessantesten Verbesserungen liegen dabei weniger in klassischen Chat-Funktionen. Entscheidend ist vielmehr, dass Grok länger an Aufgaben arbeiten, verschiedene Werkzeuge und Arbeitsschritte kombinieren und aus relativ groben Vorgaben umfangreichere Ergebnisse erstellen soll.
Gerade bei Softwareentwicklung, Recherche und agentischen Workflows könnte Grok 4.6 deshalb interessanter sein als das vergleichsweise kleine Versionsplus von 4.5 auf 4.6 zunächst vermuten lässt.
Die von xAI veröffentlichten Benchmarks zeigen gleichzeitig, dass der Wettbewerb an der Spitze weiterhin eng bleibt. Grok 4.6 erzielt in mehreren Bereichen sehr starke Ergebnisse, liegt aber nicht in jeder Kategorie vor den Konkurrenzmodellen.
Der wichtigere Entwicklungsschritt dürfte deshalb ein anderer sein: KI-Modelle werden zunehmend dafür trainiert, nicht nur Antworten zu liefern, sondern über längere Zeit selbstständig an einem konkreten Ziel zu arbeiten. Grok 4.6 ist ein weiteres Beispiel dafür, wie schnell sich große Sprachmodelle derzeit in Richtung leistungsfähiger KI-Agenten entwickeln.
Quellen
- Introducing Grok 4.6 – xAI