Neue PTP-Methode rekonstruiert Prompts aus KI-Antworten – teils nahezu exakt
Veröffentlicht am 16.08.2026
Wer nur die Antwort eines KI-Modells kennt, kennt damit noch lange nicht die ursprüngliche Frage – sollte man zumindest meinen. Eine neue Forschungsarbeit zeigt jedoch, dass sich diese Annahme nicht immer halten lässt. Mit einer Methode namens Previous-Token Prediction (PTP) können Forscher aus der Antwort eines Large Language Models einen Prompt rekonstruieren, der dem ursprünglichen Prompt teilweise erstaunlich nahekommt.
Das Besondere daran: Für den eigentlichen Rekonstruktionsvorgang reichen nach dem Training des inversen Modells grundsätzlich die Textausgaben des Zielmodells. Ein Zugriff auf Modellgewichte, Logits, Embeddings oder andere interne Repräsentationen ist nicht erforderlich.
Die Forscher sprechen deshalb von einer Form der LLM Inversion: Der normale Prozess eines Sprachmodells wird gewissermaßen umgedreht.
Sprachmodell rückwärts gedacht
Ein klassisches Large Language Model arbeitet mit sogenannter Next-Token Prediction. Es erhält einen bestehenden Text und versucht vorherzusagen, welches Token als Nächstes folgen sollte.
PTP dreht diese Idee um.
Statt vorherzusagen:
„Welches Token kommt als Nächstes?“
soll das inverse Modell lernen:
„Welches Token könnte unmittelbar davor gestanden haben?“
Dafür werden die vom ursprünglichen Sprachmodell erzeugten Token-Sequenzen umgekehrt. Das inverse Modell wird anschließend wie ein normales autoregressives Sprachmodell trainiert – nur eben auf diesen rückwärts angeordneten Sequenzen.
Aus einer vorhandenen KI-Antwort kann das Modell dadurch schrittweise rückwärts einen möglichen ursprünglichen Prompt erzeugen.
Die Forscher beschreiben das als funktionale Umkehrung des generativen Prozesses: Während das normale Modell von einem Prompt zur Antwort gelangt, soll das inverse Modell von der Antwort wieder zurück zu einer passenden Eingabe finden.
Kein Zugriff auf Modellgewichte erforderlich
Ein wichtiger Unterschied zu früheren Verfahren liegt darin, welche Informationen über das Zielmodell benötigt werden.
Einige bisherige Ansätze zur Prompt-Rekonstruktion greifen beispielsweise auf die vollständigen Wahrscheinlichkeitsverteilungen des Modells, sogenannte Logits, oder sogar auf interne Aktivierungen zurück.
PTP soll dagegen mit einem Modell funktionieren, das im Wesentlichen als Blackbox behandelt wird.
Das inverse Sprachmodell wird dabei zunächst von Grund auf neu trainiert. Die dafür benötigten Trainingsdaten erzeugt das Zielmodell selbst.
Die Forscher starten dazu Generierungen mit einzelnen Tokens aus dem Vokabular des Modells und lassen daraus längere Textsequenzen entstehen. Anschließend werden deren Tokens umgekehrt und als Trainingsmaterial für das inverse Modell verwendet.
Beim getesteten Qwen3-0.6B umfasst das Vokabular laut Paper etwa 150.000 Tokens. Bei Sequenzen mit jeweils 256 Tokens ergibt das bereits rund 38 Millionen vom Zielmodell generierte Tokens pro Trainingsdurchlauf.
Der Ansatz benötigt damit zwar keine große externe Trainingssammlung, dafür aber eine beträchtliche Zahl von Modellabfragen.
Kleines zusätzliches Fine-Tuning verbessert die Prompts
Ganz ohne reale Prompts kommt die in der Studie verwendete Variante allerdings nicht aus.
Nach dem synthetischen Vortraining führen die Forscher noch ein vergleichsweise kleines Fine-Tuning durch. Beim ShareGPT-Experiment wurden dafür lediglich 400 Prompts zum Training verwendet, weitere 100 dienten als Testdaten.
Die dazugehörigen Antworten stammen wiederum vom Zielmodell selbst.
Nach Angaben der Autoren dient dieses Fine-Tuning vor allem dazu, die Struktur und sprachliche Form der rekonstruierten Prompts zu verbessern. Die eigentliche Fähigkeit, den generativen Prozess umzukehren, soll hauptsächlich während des synthetischen Vortrainings entstehen.
Experimente im Anhang unterstützen diese Aussage: Modelle, die ausschließlich auf den wenigen realen Prompts trainiert wurden, konnten die inverse Abbildung deutlich schlechter lernen.
Bis zu 64,77 Prozent exakte Prompt-Rekonstruktion
Besonders interessant sind die Ergebnisse mit Qwen3-0.6B Chat.
Hier erreichte PTP bei der Rekonstruktion der Test-Prompts einen Exact-Match-Wert von 64,77 Prozent. Der Token-F1-Wert lag bei 63,64 Prozent.
Damit konnte in einem erheblichen Teil der Tests offenbar nicht nur die Bedeutung des ursprünglichen Prompts rekonstruiert werden, sondern dessen konkrete Tokenfolge.
Bei der Base-Version von Qwen3-0.6B fiel das Ergebnis deutlich schwächer aus: Dort erreichte PTP einen Exact-Match-Wert von 35,14 Prozent.
Interessanterweise scheint das Instruction-Tuning eines Chat-Modells die Rekonstruktion also nicht zwangsläufig schwieriger zu machen. In den Experimenten war sogar das Gegenteil der Fall.
Deutlich besser als frühere Blackbox-Ansätze
Die Forscher vergleichen PTP unter anderem mit Output-to-Prompt (O2P) und Reverse Prompt Engineering (RPE).
Auf dem verwendeten Qwen-Chat-Test erreichte PTP beim Exact Match 64,77 Prozent. Die beste getestete O2P-Variante kam dagegen auf 25,44 Prozent. RPE lag bei den strengen Token-Metriken noch deutlich darunter.
Auch beim sogenannten Closed-Loop-Test zeigte PTP starke Ergebnisse.
Dabei wird der rekonstruierte Prompt erneut an das ursprüngliche KI-Modell geschickt. Anschließend vergleichen die Forscher die neue Antwort mit der ursprünglichen Antwort.
PTP erreichte bei diesen rekonstruierten Antworten einen Exact-Match-Wert von 61,79 Prozent und eine Cosine Similarity von 88,08 Prozent.
Das ist deshalb wichtig, weil der exakt ursprüngliche Prompt gar nicht immer notwendig ist. Unterschiedlich formulierte Prompts können schließlich sehr ähnliche Antworten hervorrufen.
Ein Prompt ist nicht immer eindeutig rekonstruierbar
Genau hier liegt ein grundlegendes Problem der Prompt-Rekonstruktion.
Eine KI-Antwort lässt sich nicht zwingend auf einen einzigen Prompt zurückführen. Mehrere unterschiedliche Fragen können zu sehr ähnlichen oder sogar praktisch identischen Antworten führen.
PTP kann deshalb auch verschiedene mögliche Prompts erzeugen.
Im Paper zeigen die Forscher beispielsweise eine Antwort zum Thema Wettbewerber und Preisstrategien. Das inverse Modell kann dazu nicht nur den ursprünglichen Prompt rekonstruieren, sondern auch mehrere alternative Fragen erzeugen, die inhaltlich zu derselben Antwort passen.
Aus Sicht der Autoren ist das sogar eine Stärke des Ansatzes: Statt lediglich nach einem einzelnen ursprünglichen Prompt zu suchen, kann PTP eine Gruppe von Eingaben finden, die beim Zielmodell ein ähnliches Verhalten auslösen.
Das könnte beispielsweise interessant sein, wenn Entwickler herausfinden möchten, welche verschiedenen Eingaben ein Modell zu einem unerwünschten Ergebnis führen können.
Funktioniert die Methode auch bei anderen KI-Modellen?
Die Forscher testeten außerdem, ob ein auf einem Modell trainiertes inverses Modell auch Antworten eines anderen Sprachmodells zurückrechnen kann.
Dazu wurde das auf Qwen3-0.6B Chat trainierte inverse Modell auf Antworten von GPT-4o angewendet.
Hier zeigt sich allerdings eine entscheidende Grenze.
Die exakte Prompt-Rekonstruktion fiel deutlich ab. Beim ursprünglichen Prompt lag der Exact-Match-Wert nur noch bei 11,36 Prozent.
Trotzdem blieben verschiedene semantische Ähnlichkeitswerte vergleichsweise hoch. Beim BERT-F1 erreichten die rekonstruierten GPT-4o-Prompts beispielsweise 82,26 Prozent.
Auch die mit den rekonstruierten Prompts erneut erzeugten Antworten blieben inhaltlich häufig ähnlich zur Originalantwort.
Das bedeutet: PTP kann offenbar bis zu einem gewissen Grad zwischen verschiedenen Modellfamilien übertragen werden. Eine wirklich exakte Rekonstruktion wird bei unterschiedlichen Modellen und Tokenizern jedoch erheblich schwieriger.
Wichtige Einschränkung: Für exakte Rekonstruktion wird der Tokenizer benötigt
Der Begriff „Blackbox“ braucht deshalb eine wichtige Einschränkung.
Für eine semantische Rekonstruktion eines Prompts muss laut den Forschern der Tokenizer des Zielmodells nicht zwingend bekannt sein.
Wer allerdings exakt dieselben Token wie im ursprünglichen Prompt rekonstruieren möchte, benötigt Zugriff auf beziehungsweise Kenntnis über dessen Tokenisierung.
Die Autoren bezeichnen dies im Anhang selbst als eine entsprechende Annahme ihrer Methode.
Dazu kommt der hohe Aufwand für das synthetische Training. Ein kompletter Durchlauf mit einem Vokabular von rund 150.000 Tokens und einer Sequenzlänge von 256 entspricht ungefähr 38 Millionen generierten Tokens. Nach Angaben der Forscher dauert die Erzeugung eines solchen Durchlaufs auf einer einzelnen Nvidia A100 ungefähr eine Stunde.
Bei größeren Modellen, sehr großen Vokabularen oder kostenpflichtigen APIs könnte der notwendige Query-Aufwand damit schnell relevant werden.
Was bedeutet das für KI-Anwendungen?
Die Ergebnisse zeigen vor allem, dass KI-Ausgaben möglicherweise mehr Informationen über die zugrunde liegende Eingabe enthalten als auf den ersten Blick erkennbar ist.
Das bedeutet nicht, dass sich nun aus jeder beliebigen ChatGPT-, Claude- oder Gemini-Antwort zuverlässig der geheime Original-Prompt zurückgewinnen lässt. Gerade die deutlich schwächeren Ergebnisse bei unterschiedlichen Modellfamilien zeigen die Grenzen des Ansatzes.
Dennoch ist die Arbeit aus Sicht der KI-Sicherheit interessant.
Wenn inverse Modelle künftig leistungsfähiger werden, könnte eine Antwort eines Sprachmodells zunehmend Hinweise darauf liefern, durch welche Eingaben sie ausgelöst wurde. Das könnte einerseits zur Analyse und Absicherung von KI-Systemen genutzt werden – beispielsweise um problematische Prompt-Gruppen zu identifizieren.
Andererseits macht die Forschung deutlich, dass Prompts nicht grundsätzlich als Informationen betrachtet werden sollten, die durch die Veröffentlichung einer Modellantwort automatisch verborgen bleiben.
Fazit
PTP verfolgt einen ungewöhnlich einfachen Grundgedanken: Wenn Sprachmodelle lernen können, welches Token als Nächstes kommt, müsste sich möglicherweise auch lernen lassen, welches Token zuvor gekommen ist.
Die Experimente zeigen, dass dieser Ansatz überraschend gut funktionieren kann. Beim getesteten Qwen3-0.6B-Chat-Modell wurden rund 64,8 Prozent der Prompts exakt rekonstruiert – deutlich mehr als bei den untersuchten Vergleichsverfahren.
Von einem universellen Werkzeug zum Auslesen beliebiger Prompts kann allerdings noch keine Rede sein. Modellwechsel, andere Tokenizer und unterschiedliche Architekturen lassen die Genauigkeit stark sinken. Hinzu kommen der erhebliche Query-Aufwand für das Training und die Tatsache, dass für eine exakte Rekonstruktion Kenntnisse über den Tokenizer erforderlich sind.
Trotz dieser Einschränkungen zeigt die Studie eine interessante neue Richtung: Die Ausgabe eines Sprachmodells ist möglicherweise nicht nur das Endergebnis einer Anfrage – sie kann zugleich Informationen enthalten, aus denen sich Teile der ursprünglichen Eingabe wieder zurückrechnen lassen.
Quellen
- PTP: Previous-Token Prediction (arXiv) – arxiv.org