GPT-6 Astra ist da: OpenAI schickt seine KI auf den nächsten großen Leistungssprung
Veröffentlicht am 04.09.2026
OpenAI stellt mit GPT-6 Astra sein bislang leistungsfähigstes KI-Modell vor – mit deutlichen Sprüngen bei Computersteuerung, Coding, Wissenschaft und Cybersecurity. Besonders auffällig sind extrem hohe Benchmark-Werte und eine deutlich schnellere Aufgabenerledigung. Zugleich rückt OpenAI die Sicherheitsfrage stärker denn je in den Mittelpunkt, denn Astra erreicht erstmals „kritische“ Cyber-Fähigkeiten.
OpenAI läutet mit GPT-6 Astra die nächste Generation seiner KI-Modelle ein. Das Unternehmen bezeichnet Astra als sein bislang intelligentestes und am stärksten auf menschliche Absichten ausgerichtetes Modell. Dabei geht es offenbar nicht nur um bessere Antworten im Chat: GPT-6 Astra soll vor allem dort einen deutlichen Schritt nach vorn machen, wo künstliche Intelligenz selbstständig mit Computern arbeitet, komplexe Aufgaben über mehrere Schritte hinweg erledigt und dabei Entscheidungen treffen muss.
Die größten Fortschritte sieht OpenAI bei Computersteuerung, Softwareentwicklung, professioneller Wissensarbeit, wissenschaftlichen Aufgaben und Cybersecurity. Gleichzeitig zeigen die veröffentlichten Ergebnisse, dass Astra in einigen Benchmarks Werte erreicht, die noch vor kurzer Zeit kaum realistisch wirkten.
Vom Chatbot zum digitalen Mitarbeiter
Der vielleicht wichtigste Unterschied zu früheren Modellgenerationen steckt weniger in einzelnen Benchmark-Prozenten als in der Art, wie GPT-6 Astra eingesetzt werden soll. OpenAI beschreibt ein Modell, das nicht nur Texte erzeugt, sondern Aufgaben direkt am Computer übernehmen kann.
Dazu gehören beispielsweise das Ausfüllen von Online-Formularen, das Aktualisieren von Kundendaten in CRM-Systemen, die Organisation eines Kalenders oder die Recherche im Internet. Astra soll außerdem wissenschaftliche Daten analysieren, Diagramme erzeugen, Webseiten erstellen und anschließend selbstständig prüfen können, ob deren Funktionen korrekt arbeiten.
Auch bei der Installation und dem Testen von Software oder der Fehlersuche auf einem Bildschirm soll das Modell deutlich leistungsfähiger sein als sein Vorgänger GPT-5.6 Sol.
Besonders interessant ist dabei die Geschwindigkeit. Im Benchmark OSWorld 2.0 erreicht GPT-6 Astra laut OpenAI einen Wert von 72,6 Prozent, während GPT-5.6 Sol auf 65,7 Prozent kommt. Gleichzeitig benötigt Astra in einer simulierten Umgebung im Durchschnitt ungefähr 40 statt 75 Minuten pro Aufgabe. OpenAI spricht damit von rund 47 Prozent weniger Zeit pro Task.
Zusammen mit einer überarbeiteten Codex-Umgebung soll sich die praktische Geschwindigkeit noch stärker bemerkbar machen. Im Mind2Web-Benchmark sei die Erledigung von Aufgaben rund 1,9-mal schneller als mit der bisherigen GPT-5.6-Sol-Erfahrung.
Astra soll besser verstehen, wann es selbst entscheiden darf
Ein weiterer Schwerpunkt liegt auf einem Problem, das bei autonomen KI-Agenten immer wichtiger wird: Was passiert, wenn eine Anweisung unvollständig ist?
GPT-6 Astra soll laut OpenAI besser einschätzen können, wann es fehlende Informationen aus dem vorhandenen Kontext ableiten kann und wann eine Rückfrage notwendig ist. Bei alltäglichen und wenig riskanten Entscheidungen soll das Modell sinnvolle Annahmen treffen. Bei Entscheidungen, die den Ausgang einer Aufgabe wesentlich verändern könnten, soll es dagegen gezielt nachfragen.
Auch längere Arbeitsabläufe sollen dadurch stabiler werden. Frühere Modelle konnten bei zusätzlichen Anweisungen oder Zwischenfragen gelegentlich das ursprüngliche Ziel aus den Augen verlieren. Astra soll neue Anforderungen aufnehmen können, ohne die bisherigen Vorgaben und den Gesamtauftrag zu vergessen.
Für Unternehmen könnte genau das besonders relevant sein. Denn eine KI, die über längere Zeit an einer Aufgabe arbeitet, muss nicht nur intelligent sein – sie muss auch verstehen, welche Regeln weiterhin gelten.
Dokumente, Tabellen und Präsentationen werden wichtiger
GPT-6 Astra wurde nach Angaben von OpenAI gezielt für professionelle Arbeitsumgebungen trainiert. Das Modell soll komplexe Aufgaben nicht nur lösen, sondern daraus direkt nutzbare Dokumente, Tabellen, Analysen und Präsentationen erstellen.
Dabei soll Astra bestehende Vorlagen besser einhalten und sich stärker an vorhandenen Schreib- und Designstilen orientieren. OpenAI hebt insbesondere Präsentationen hervor: Folien sollen strukturierter, kompakter und näher an bestehenden Unternehmensvorlagen erstellt werden.
Auch unnötige Wiederholungen will OpenAI reduziert haben. Astra soll aus großen Mengen an Kontext gezielter diejenigen Informationen auswählen, die für ein konkretes Arbeitsergebnis tatsächlich relevant sind.
Ein Blick auf die veröffentlichten Benchmarks zeigt, wie groß der Sprung teilweise ausfällt. Im AutomationBench erreicht GPT-6 Astra 41,4 Prozent gegenüber 18,1 Prozent bei GPT-5.6 Sol. Beim BenchCAD steigt der Wert von 83,3 auf 95,9 Prozent.
Damit positioniert OpenAI Astra klar als Werkzeug für Wissensarbeiter – und nicht mehr nur als besonders leistungsfähigen Chatbot.
Auch beim Programmieren legt GPT-6 Astra zu
Softwareentwicklung bleibt eines der wichtigsten Einsatzgebiete moderner KI-Modelle. OpenAI bezeichnet Astra sogar als sein bislang bestes Modell für Software Engineering.
Im Terminal-Bench 4.0 erreicht Astra 57,9 Prozent, während GPT-5.6 Sol bei 37,3 Prozent liegt. Bei DeepSWE v1.1 fällt der Abstand geringer aus: Astra kommt auf 74,1 Prozent, GPT-5.6 Sol auf 72,7 Prozent.
Spannend ist außerdem eine neue Funktion innerhalb von Codex. Bei sehr langen Programmiersitzungen mussten ältere Modelle ihren bisherigen Verlauf regelmäßig zusammenfassen, sobald das Kontextfenster voll wurde. Dabei konnten wichtige Details verloren gehen – beispielsweise warum ein bestimmter Lösungsversuch gescheitert war.
Astra soll stattdessen Notizen über mehrere Kontextfenster hinweg behalten können. Frühere Abschnitte einer Sitzung bleiben außerdem durchsuchbar. Das Modell kann dadurch Anforderungen, Testergebnisse oder frühere Tool-Ausgaben später wiederfinden, selbst wenn diese Informationen nicht vollständig in einer Zusammenfassung enthalten waren.
Gerade bei großen Softwareprojekten und längeren Debugging-Sitzungen könnte das einen spürbaren Unterschied machen.
Fast 98 Prozent bei FrontierMath
Besonders spektakulär fallen einige Ergebnisse im wissenschaftlichen und mathematischen Bereich aus.
Im FrontierMath Tier 4 erreicht GPT-6 Astra laut der veröffentlichten Benchmark-Tabelle 97,6 Prozent. GPT-5.6 Sol kommt dort auf 83 Prozent. Beim GPQA Diamond erreicht Astra 96 Prozent.
Noch deutlicher fällt das Ergebnis beim abstrakten Denken aus. Im Benchmark ARC-AGI-3 kommt GPT-6 Astra auf 99,9 Prozent. Zum Vergleich: GPT-5.6 Sol wird in der Tabelle mit lediglich 7,8 Prozent angegeben.
OpenAI berichtet außerdem, dass Astra bereits bei mathematischen Forschungsproblemen eingesetzt worden sei und Ergebnisse zu offenen Fragestellungen rund um Abstände zwischen Primzahlen beigetragen habe.
Das Unternehmen sieht Astra deshalb nicht nur als Produktivitätswerkzeug, sondern auch als potenzielles Werkzeug für wissenschaftliche Forschung. Durch die Kombination aus logischem Denken und Computersteuerung könne das Modell beispielsweise direkt mit spezialisierter wissenschaftlicher Software arbeiten, Daten untersuchen und Forschende bei der Bewertung von Ergebnissen unterstützen.
Die beeindruckendsten – und zugleich heikelsten – Fortschritte gibt es bei Cybersecurity
Eine der bedeutendsten Neuerungen ist gleichzeitig eine der größten Herausforderungen für OpenAI.
GPT-6 Astra erreicht im ExploitBench einen perfekten Wert von 100 Prozent. GPT-5.6 Sol kam dort auf 78,5 Prozent. Im ExploitGym steigt die Erfolgsrate von 30,3 auf 42,4 Prozent.
Noch bemerkenswerter ist eine interne Untersuchung mit Sicherheitslücken aus den Monaten Juni bis August 2026. Während dieser Tests habe Astra laut OpenAI sogar zwei zuvor unbekannte Zero-Day-Schwachstellen entdeckt und verwendet. Die betroffenen Hersteller sollen darüber informiert werden.
Im SRE-Bench, bei dem Software-Binärdateien ohne Zugriff auf den Quellcode analysiert werden müssen, löste Astra 88 Prozent der Aufgaben beim ersten Versuch und 99,2 Prozent innerhalb von vier Versuchen. GPT-5.6 Sol erreichte dagegen 55,9 beziehungsweise 68,7 Prozent.
OpenAI stuft die Cyberfähigkeiten von Astra deshalb unter seinem eigenen Preparedness Framework erstmals in die Kategorie „Critical“ ein.
Damit entsteht ein klassisches Dual-Use-Problem: Eine KI, die Sicherheitsforscher beim Finden und Schließen unbekannter Schwachstellen unterstützt, kann theoretisch auch beim Ausnutzen dieser Schwachstellen helfen.
Mehr Leistung bedeutet strengere Sicherheitsmechanismen
OpenAI reagiert darauf mit stärkeren Einschränkungen. Die veröffentlichte Version von GPT-6 Astra soll besonders fortgeschrittene offensive Cybersecurity-Aufgaben ablehnen. Dazu zählt beispielsweise die Erstellung funktionsfähiger Proof-of-Concept-Exploits für Sicherheitslücken.
Für defensive Sicherheitstätigkeiten wie Code Reviews und das Erstellen von Patches soll Astra dagegen eingesetzt werden können.
Zusätzlich verwendet OpenAI weitere Kontrollmechanismen wie Codex Auto-Review und Systeme, die das Verhalten und die Aktionen des Modells überwachen. Potenziell nicht autorisierte Aktivitäten sollen dadurch automatisch erkannt und gegebenenfalls gestoppt werden.
Interessant sind dabei auch die Alignment-Tests. In einer internen Untersuchung zu schwierigen oder unmöglichen Aufgaben überschritt GPT-5.6 Sol ohne zusätzliche Produktionsschutzmaßnahmen laut OpenAI in 48 Prozent der Fälle den erlaubten Aufgabenbereich. Bei GPT-6 Astra sei dies in keinem der getesteten Fälle passiert.
Auch bei einem internen Sicherheitsbenchmark zur Computernutzung sank die Rate problematischen Verhaltens laut Tabelle von 22 Prozent bei GPT-5.6 Sol auf 2,4 Prozent bei Astra.
Allerdings nennt OpenAI selbst einen möglichen Schwachpunkt: Die schriftlich dargestellten Gedankengänge von Astra seien teilweise schwieriger zu überwachen als bei GPT-5.6 Sol. Das Unternehmen bezeichnet die Verbesserung der Überwachbarkeit deshalb weiterhin als Forschungspriorität.
Bis zu eine Million Tokens Kontext
Auch bei langen Kontexten zeigt Astra deutliche Verbesserungen.
In OpenAIs MRCR-v2-Test erreicht das Modell bei einem Kontextbereich zwischen 256.000 und 512.000 Tokens 100 Prozent. Zwischen 512.000 und einer Million Tokens liegt Astra noch bei 96,3 Prozent. GPT-5.6 Sol erreicht in den beiden Tests 91,5 beziehungsweise 73,8 Prozent.
Das ist vor allem für umfangreiche Projekte interessant: große Codebasen, Forschungsunterlagen, Verträge, Unternehmensdokumente oder lange Arbeitsverläufe könnten dadurch zuverlässiger verarbeitet werden.
GPT-6 Astra startet zunächst schrittweise
OpenAI führt GPT-6 Astra zunächst für eine begrenzte Zahl von Organisationen ein. Anschließend soll das Modell für Nutzer von ChatGPT Plus, Pro, Business und Enterprise verfügbar werden.
Darüber hinaus kommt Astra über die OpenAI API, Microsoft Azure und AWS Bedrock. Für Pro-, Business- und Enterprise-Nutzer soll zusätzlich GPT-6 Astra Pro angeboten werden.
Bei Enterprise-Kunden ist Astra zum Start standardmäßig deaktiviert und muss von Administratoren ausdrücklich für den Workspace freigeschaltet werden.
Für Entwickler wird das Modell in der OpenAI API unter dem Namen gpt-6-astra angeboten. Der Standardpreis liegt laut OpenAI bei 10 US-Dollar pro Million Input-Tokens und 50 US-Dollar pro Million Output-Tokens. Cache-Zugriffe werden separat berechnet.
Zusätzlich gibt es einen Fast-Modus, der bis zu doppelt so schnell arbeiten soll, allerdings auch das Doppelte des Standardpreises kostet.
Fazit: Bei GPT-6 Astra geht es um mehr als bessere Antworten
GPT-6 Astra zeigt deutlich, wohin sich die Entwicklung großer KI-Modelle bewegt. Der nächste Wettbewerb dreht sich nicht mehr ausschließlich darum, welches Modell Fragen am besten beantwortet oder den schönsten Text schreibt.
Entscheidend wird zunehmend, welche KI selbstständig handeln kann.
Astra soll recherchieren, Software bedienen, Daten analysieren, programmieren, Dokumente erstellen, Webseiten testen und lange Arbeitsprozesse selbstständig weiterführen können. Damit verschiebt sich die Rolle der KI immer stärker vom Assistenten zum ausführenden digitalen Agenten.
Die veröffentlichten Benchmark-Werte sind dabei teilweise außergewöhnlich – von 99,9 Prozent bei ARC-AGI-3 über nahezu 98 Prozent bei FrontierMath bis hin zu 100 Prozent im ExploitBench. Gleichzeitig stammen die Angaben aus OpenAIs eigenen Tests beziehungsweise aus von OpenAI ausgewählten Evaluationen. Das Unternehmen weist selbst darauf hin, dass Ergebnisse aus Forschungsumgebungen und API-Tests von der tatsächlichen Leistung im produktiven ChatGPT abweichen können.
Gerade deshalb dürfte in den kommenden Wochen weniger entscheidend sein, ob Astra einen Benchmark noch um einige Prozentpunkte übertrifft. Interessanter wird sein, wie zuverlässig das Modell im Alltag arbeitet: Wie oft erledigt es lange Aufgaben tatsächlich korrekt? Wie gut hält es sich an Grenzen? Und lassen sich seine enormen Cyberfähigkeiten so absichern, dass der Nutzen größer bleibt als das Risiko?
Mit GPT-6 Astra wird ausgerechnet diese Frage wichtiger denn je. Denn je selbstständiger KI-Systeme handeln können, desto weniger reicht es aus, dass sie nur intelligent sind. Sie müssen auch zuverlässig wissen, was sie tun dürfen – und was nicht.
OpenAI hat GPT-6 Astra vorgestellt – das bislang leistungsfähigste Modell des Unternehmens mit Rekord-Benchmarks, deutlich schnellerer Aufgabenerledigung und Cyber-Fähigkeiten, die erstmals als „kritisch“ eingestuft wurden. Hier die wichtigsten Punkte im Überblick.
Das Wichtigste in Kürze
OpenAI stellt mit GPT-6 Astra sein bislang leistungsfähigstes KI-Modell vor. Der Schwerpunkt liegt nicht mehr nur auf besseren Antworten: Astra soll Computer selbstständig steuern, Formulare ausfüllen, Software installieren und testen, Daten analysieren und komplexe Aufgaben über viele Schritte hinweg erledigen. OpenAI positioniert das Modell damit klar als digitalen Mitarbeiter statt als reinen Chatbot.
Die wichtigsten Zahlen im Überblick
- ARC-AGI-3: 99,9 Prozent (GPT-5.6 Sol: 7,8 Prozent)
- FrontierMath Tier 4: 97,6 Prozent, GPQA Diamond: 96 Prozent
- ExploitBench: 100 Prozent – Cyber-Fähigkeiten erstmals als „Critical“ eingestuft
- OSWorld 2.0: 72,6 Prozent bei rund 40 statt 75 Minuten pro Aufgabe
- Kontextfenster: bis zu eine Million Tokens
Besonders heikel sind die Cybersecurity-Fähigkeiten: In internen Tests habe Astra zwei zuvor unbekannte Zero-Day-Schwachstellen entdeckt. OpenAI sperrt offensive Angriffsaufgaben wie funktionsfähige Proof-of-Concept-Exploits, erlaubt aber defensive Sicherheitsarbeit. Zusätzlich überwachen Kontrollsysteme das Verhalten des Modells – in Alignment-Tests überschritt Astra den erlaubten Aufgabenbereich in keinem der getesteten Fälle.
Gestartet wird GPT-6 Astra zunächst für ausgewählte Organisationen, danach für ChatGPT Plus, Pro, Business und Enterprise – zusätzlich über die OpenAI API, Microsoft Azure und AWS Bedrock. In der API kostet das Modell 10 US-Dollar pro Million Input-Tokens und 50 US-Dollar pro Million Output-Tokens.