Sicherheitslücke bei Claude, GPT und Gemini: Forscher entschlüsseln versteckte Reasoning-Traces
Veröffentlicht am 13.08.2026
Verschlüsselt bedeutet nicht automatisch sicher. Sicherheitsforscher haben eine Schwachstelle in den APIs großer KI-Anbieter aufgedeckt, über die sich eigentlich verborgene Reasoning-Prozesse von KI-Modellen teilweise wieder in Klartext umwandeln ließen. Betroffen waren nach Angaben der Forscher Systeme von Anthropic, OpenAI und Google.
In ihrer Arbeit „Stealing Reasoning Traces from Proprietary LLM APIs“ zeigen Alexander Panfilov und weitere Forscher, wie verschlüsselte Denk- beziehungsweise Reasoning-Blöcke zwischen unterschiedlichen Sitzungen, Nutzern und sogar verschiedenen Modellen eines Anbieters übertragen werden konnten.
Besonders brisant: Für den Angriff musste nicht einmal das leistungsstärkste Modell selbst geknackt werden. Stattdessen konnten schwächere Modelle innerhalb derselben Modellfamilie teilweise als eine Art unfreiwilliger „Decoder“ verwendet werden.
Die Auswirkungen gingen dabei deutlich über den Schutz geistigen Eigentums hinaus. In öffentlich verfügbaren Sitzungsprotokollen fanden die Forscher Hunderttausende verschlüsselte Reasoning-Blöcke und konnten daraus unter anderem personenbezogene Daten und Zugangsdaten rekonstruieren.
Warum KI-Anbieter ihre internen Gedankengänge verschlüsseln
Moderne Reasoning-Modelle erzeugen vor ihrer sichtbaren Antwort häufig umfangreiche interne Zwischenschritte. Darin zerlegt das Modell beispielsweise eine Aufgabe, prüft verschiedene Lösungswege, verwirft Ansätze oder verarbeitet Informationen aus vorherigen Nachrichten und Werkzeugaufrufen.
Für KI-Anbieter sind solche Reasoning-Traces aus mehreren Gründen sensibel.
Zum einen könnten Konkurrenten sie als besonders wertvolle Trainingsdaten verwenden und damit das Verhalten eines leistungsfähigen Modells besser nachbilden. Zum anderen können darin Informationen auftauchen, die bewusst nicht Teil der endgültigen Antwort werden – darunter sicherheitsrelevante Inhalte, Nutzerdaten oder Zugangsdaten.
Deshalb liefern einige APIs den eigentlichen Reasoning-Prozess nicht als normalen Klartext zurück. Stattdessen erhält der Client einen undurchsichtigen beziehungsweise verschlüsselten Block, der bei späteren API-Aufrufen erneut an den Anbieter übertragen werden kann.
Das hat einen praktischen Vorteil: Der Anbieter muss den kompletten Gesprächszustand nicht dauerhaft auf seinen Servern speichern.
Genau dieses Design wurde jedoch zum Problem.
Verschlüsselte Reasoning-Blöcke ließen sich zwischen Modellen übertragen
Nach den Untersuchungen der Forscher waren diese verschlüsselten Blöcke zumindest zum Zeitpunkt der Tests teilweise überraschend portabel.
Ein Reasoning-Block konnte nicht nur innerhalb derselben Unterhaltung wiederverwendet werden, sondern teilweise auch in einer anderen Sitzung, von einem anderen Nutzer oder sogar mit einem anderen Modell desselben Anbieters.
Damit entstand eine Sicherheitslücke zwischen unterschiedlich stark geschützten Modellen.
Ein leistungsfähiges Frontier-Modell kann beispielsweise speziell darauf trainiert sein, seine internen Gedankengänge nicht herauszugeben. Ein kleineres und günstigeres Modell derselben Familie besitzt möglicherweise schwächere Schutzmechanismen.
Die Forscher machten sich genau diesen Unterschied zunutze: Sie nahmen einen verschlüsselten Reasoning-Block eines leistungsstärkeren Modells und übergaben ihn einem kompatiblen schwächeren Modell.
Dieses konnte anschließend dazu gebracht werden, Teile des darin enthaltenen Reasonings wieder als Klartext auszugeben.
Das stärkere Modell selbst musste dafür nicht direkt überwunden werden.
Claude, GPT und Gemini untersucht
Die Forscher demonstrierten das Prinzip bei Modellen aus den Ökosystemen von Anthropic, OpenAI und Google.
Dabei identifizierten sie für jeden Anbieter Modelle, die sich besonders gut als Decoder für verschlüsselte Reasoning-Traces stärkerer Modelle eigneten.
Das macht die Schwachstelle aus Sicherheitssicht besonders interessant: Die Sicherheit eines leistungsstarken KI-Modells hängt damit nicht mehr ausschließlich von dessen eigenen Schutzmechanismen ab.
Wenn ein schwächeres Modell dieselben verschlüsselten Daten lesen kann, kann dieses zum schwächsten Glied innerhalb der gesamten Modellfamilie werden.
Oder anders gesagt: Ein hervorragend geschütztes Frontier-Modell hilft wenig, wenn ein günstigeres Modell desselben Anbieters dessen verschlüsseltes Reasoning verarbeiten und anschließend preisgeben kann.
315.320 Reasoning-Blöcke aus öffentlichen Daten untersucht
Besonders problematisch wird das Ganze bei öffentlich veröffentlichten KI-Sitzungen.
Entwickler, Forscher und Betreiber von KI-Agenten veröffentlichen teilweise komplette Ausführungsprotokolle auf Plattformen wie GitHub oder Hugging Face. Sichtbare Inhalte können dabei vorher bereinigt oder anonymisiert werden.
Das Problem: Der Inhalt eines verschlüsselten Reasoning-Blocks ist für den Nutzer selbst nicht sichtbar.
Wer also beispielsweise eine E-Mail-Adresse oder einen API-Schlüssel aus dem sichtbaren Chat entfernt, weiß nicht unbedingt, ob das KI-Modell diese Information zuvor noch einmal innerhalb seines versteckten Reasonings verarbeitet hat.
Die Forscher sammelten 6.708 öffentlich verfügbare Agenten- und Sitzungsverläufe und rekonstruierten daraus insgesamt 315.320 Reasoning-Blöcke.
In 1.028 dieser Blöcke fanden sie mindestens einen möglichen Datenschutzverstoß. Auf Ebene der kompletten Sitzungen enthielten 328 der 6.708 untersuchten Verläufe mindestens ein sensibles Element.
Insgesamt identifizierten die Forscher unter anderem:
- 367 unterschiedliche personenbezogene Informationen,
- 182 Credentials beziehungsweise Zugangsdaten,
- 62 API-Schlüssel aus echten Nutzersitzungen,
- 33 Passwörter,
- 24 Access-Tokens,
- 7 private Schlüssel sowie
- 30 persönliche E-Mail-Adressen.
Hinzu kamen unter anderem Namen, Postanschriften und IP-Adressen.
Besonders bemerkenswert: Einige sensible Informationen waren im öffentlich sichtbaren Gespräch überhaupt nicht mehr vorhanden. Sie existierten nur noch innerhalb des verschlüsselten Reasoning-Blocks.
Vier unterschiedliche Angriffsmöglichkeiten
Die Forscher beschreiben insgesamt vier wesentliche Gefahren.
Erstens könnten entschlüsselte Reasoning-Traces für die Distillation proprietärer KI-Modelle verwendet werden. Ein Konkurrent erhält damit nicht nur Antworten eines Modells, sondern möglicherweise auch dessen Zwischenschritte und Lösungsstrategien.
Zweitens können öffentlich veröffentlichte Reasoning-Blöcke personenbezogene Informationen und Zugangsdaten enthalten.
Drittens zeigte die Untersuchung, dass der interne Denkprozess teilweise Informationen enthalten kann, die das Modell in seiner sichtbaren Antwort bewusst nicht ausgibt. Sicherheitsfilter können damit zwar die endgültige Antwort blockieren, während sensible oder problematische Informationen trotzdem im versteckten Reasoning vorhanden sind.
Viertens können verschlüsselte Blöcke selbst als unsichtbarer Prompt-Injection-Kanal dienen. Ein manipuliertes Reasoning könnte einem KI-Agenten Anweisungen mitgeben, die für den Nutzer im sichtbaren Gespräch nicht erkennbar sind.
Gerade bei autonomen KI-Agenten wäre das problematisch, weil diese Dateien bearbeiten, Tools aufrufen oder externe Dienste verwenden können.
Die Anbieter haben reagiert – der konkrete Angriff funktioniert nicht mehr
Die Forscher meldeten ihre Ergebnisse vor der Veröffentlichung an die betroffenen KI-Anbieter sowie unter anderem an Microsoft und Hugging Face.
Nach Angaben der Autoren bestätigten die Modellanbieter den Eingang der Meldungen und nahmen anschließend Änderungen an ihren Systemen vor.
Entscheidend ist deshalb: Der im Paper beschriebene Angriff sollte nicht so dargestellt werden, als ließe er sich heute unverändert weiter ausführen.
Die Autoren schreiben ausdrücklich, dass sich die in ihrer Arbeit gezeigten Ergebnisse im August 2026 mit den beschriebenen Angriffsmethoden nicht mehr reproduzieren lassen, nachdem die Anbieter Gegenmaßnahmen umgesetzt hatten.
Damit wurde die unmittelbar demonstrierte Sicherheitslücke offenbar erfolgreich entschärft.
Ganz erledigt ist das Problem trotzdem nicht.
Ist die Sicherheitslücke damit wirklich geschlossen?
Hier muss zwischen drei unterschiedlichen Ebenen unterschieden werden.
Der konkrete Cross-Session- beziehungsweise Cross-Model-Angriff ist nach Angaben der Forscher geschlossen.
Die exakt im Paper beschriebene Methode funktioniert nach den Änderungen der Anbieter nicht mehr.
Bereits offengelegte Informationen lassen sich dagegen nicht zurückholen.
Wenn ein API-Schlüssel, Passwort oder eine andere sensible Information bereits vor dem Patch aus einem Reasoning-Trace extrahiert und von einem Dritten gespeichert wurde, kann ein Software-Patch diese Kopie selbstverständlich nicht wieder löschen.
In solchen Fällen hilft nur, betroffene Zugangsdaten auszutauschen beziehungsweise zu widerrufen.
Das bedeutet aber nicht automatisch, dass sämtliche alten verschlüsselten Reasoning-Blöcke heute weiterhin entschlüsselbar sind.
Im Gegenteil: Für sogenannte Legacy-Daten empfehlen die Forscher, alte kryptografische Schlüssel zu rotieren und Reasoning-Blöcke mit zurückgezogenen Schlüssel-IDs grundsätzlich nicht mehr zu akzeptieren. Dadurch könnten bereits veröffentlichte alte Signaturen nachträglich für die API unbrauchbar gemacht werden.
Das Paper bestätigt allerdings nicht, welche konkrete technische Gegenmaßnahme jeder einzelne Anbieter implementiert hat. Bestätigt wird lediglich, dass die ursprünglichen Angriffe nach den Änderungen nicht mehr funktionierten.
Auch eine weitere Annahme sollte korrigiert werden: Die Forscher geben an, die bei ihrer Untersuchung gefundenen Zugangsdaten nach der automatisierten Klassifizierung und statistischen Auswertung sicher gelöscht zu haben.
Das Risiko historischer Daten besteht deshalb vor allem darin, dass Informationen, die bereits vor der Behebung der Schwachstelle von anderen Personen kopiert wurden, nicht mehr zurückgeholt werden können.
Ein grundlegendes Designrisiko bleibt
Noch interessanter ist deshalb die zweite Ebene: die Architektur selbst.
Die Forscher weisen darauf hin, dass verschlüsselte Reasoning-Blöcke grundsätzlich eine schwierige Sicherheitseigenschaft besitzen.
Ein Nutzer kann den Inhalt nicht lesen.
Das KI-Modell muss ihn jedoch lesen können.
Wenn eine frühere Reasoning-Sequenz in einer neuen Anfrage weiterverarbeitet werden soll, muss das jeweilige Modell den verschlüsselten Inhalt zwangsläufig wieder entschlüsseln und interpretieren können.
Genau daraus ergibt sich ein strukturelles Restrisiko.
Selbst wenn ein Reasoning-Block inzwischen fest an einen bestimmten Nutzer und eine bestimmte Sitzung gebunden wird, muss mindestens das legitime Modell weiterhin auf dessen Inhalt zugreifen können.
Sollte künftig ein neuer Jailbreak gefunden werden, der dieses Modell dazu bringt, das eigene vorherige Reasoning auszugeben, könnte erneut ein ähnliches Problem entstehen.
Die Forscher formulieren deshalb eine bemerkenswert deutliche Schlussfolgerung: Verschlüsselte Reasoning-Blöcke sollten nicht wie ein vertraulicher Datenspeicher behandelt werden.
Sie sind zwar für den Nutzer nicht direkt lesbar, bleiben aber für das KI-System selbst erreichbar.
Damit wurde zwar der jetzt demonstrierte Angriff geschlossen, die grundsätzliche Angriffsfläche verschwindet durch Verschlüsselung allein jedoch nicht.
Wie sich das Problem besser lösen ließe
Die Autoren schlagen mehrere Schutzmaßnahmen vor.
Eine Möglichkeit wäre, Reasoning-Traces überhaupt nicht mehr beim Client zu speichern. Statt des verschlüsselten Inhalts würde die API lediglich eine zufällige Kennung zurückgeben. Der tatsächliche Reasoning-Zustand verbliebe vollständig beim Anbieter.
Das wäre sicherer, würde allerdings mehr serverseitigen Speicher und eine aufwendigere Infrastruktur erfordern.
Eine Alternative ist die kryptografische Bindung der Reasoning-Blöcke an Nutzer und Sitzung.
Ein Block könnte beispielsweise nur noch dann akzeptiert werden, wenn Nutzerkonto, Session und vorheriger Gesprächszustand mit den beim Erstellen gespeicherten Informationen übereinstimmen.
Damit ließe sich verhindern, dass ein Reasoning-Block einfach in eine fremde Unterhaltung oder zu einem anderen Nutzer übertragen wird.
Zusätzlich schlagen die Autoren strengere Trennung zwischen Modellen, Widerrufsmechanismen für kompromittierte Signaturen und spezielle Trainingsmaßnahmen gegen Reasoning-Extraction-Jailbreaks vor.
Entwickler sollten verschlüsselte Reasoning-Blöcke nicht veröffentlichen
Für Entwickler ergibt sich aus der Studie eine relativ einfache Konsequenz.
Rohdaten von KI-APIs sollten nicht ungeprüft veröffentlicht werden – selbst wenn die darin enthaltenen Reasoning-Blöcke verschlüsselt aussehen.
Wer Sitzungsprotokolle, Agenten-Trajektorien oder API-Dumps auf GitHub, Hugging Face oder anderen Plattformen veröffentlicht, sollte undurchsichtige Reasoning-Felder und Signaturen möglichst vollständig entfernen.
Das gilt insbesondere dann, wenn das KI-System während der Sitzung Zugriff auf Passwörter, API-Schlüssel, personenbezogene Daten oder interne Unternehmensinformationen hatte.
Waren entsprechende Protokolle bereits öffentlich verfügbar, sollten darin verwendete Zugangsdaten vorsorglich überprüft und gegebenenfalls erneuert werden.
Fazit: Patch geschlossen, Sicherheitsfrage bleibt
Die Untersuchung zeigt ein ungewöhnliches Sicherheitsproblem moderner Reasoning-Modelle: Daten wurden verschlüsselt, um sie vor Nutzern und Konkurrenten zu verbergen – konnten aber ausgerechnet über andere Modelle desselben Anbieters wieder sichtbar gemacht werden.
Mit 315.320 analysierten Reasoning-Blöcken demonstrieren die Forscher außerdem, dass dies kein rein theoretisches Szenario war. In öffentlich verfügbaren KI-Protokollen befanden sich tatsächlich personenbezogene Informationen und Zugangsdaten.
Die gute Nachricht ist, dass Anthropic, OpenAI und Google nach der verantwortungsvollen Offenlegung reagiert haben. Der konkret demonstrierte Angriff lässt sich laut den Forschern inzwischen nicht mehr reproduzieren.
Trotzdem bleibt eine wichtige Erkenntnis bestehen: Ein Patch kann bereits offengelegte Informationen nicht zurückholen. Und solange verschlüsseltes Reasoning vom KI-Modell selbst wieder entschlüsselt und verarbeitet werden muss, bleibt eine grundlegende Angriffsfläche bestehen.
Die eigentliche Sicherheitslücke ist damit zwar geschlossen – das zugrunde liegende Designproblem verschlüsselter, clientseitig gespeicherter Reasoning-Traces ist jedoch noch nicht endgültig gelöst.
Quellen
- Stealing Reasoning Traces from Proprietary LLM APIs – Alexander Panfilov et al.