Forscher zeigen neue Erkennungsmethode für KI-Texte mit unsichtbaren Wasserzeichen

Veröffentlicht am 11.08.2026

Unsichtbare Wasserzeichen für KI-Texte erkennen

Mit ChatGPT und anderen großen Sprachmodellen lassen sich innerhalb weniger Sekunden Artikel, E-Mails, Programmcode oder ganze Aufsätze erzeugen. Gleichzeitig wird es immer schwieriger zu erkennen, ob ein Text tatsächlich von einem Menschen geschrieben wurde. Forscher der University of Maryland haben deshalb eine Methode entwickelt, mit der sich KI-generierte Texte bereits bei ihrer Entstehung mit einem unsichtbaren statistischen Wasserzeichen versehen lassen.

Das Besondere daran: Der Text soll für Menschen praktisch unverändert wirken. Ein spezieller Algorithmus kann das versteckte Muster dagegen erkennen – teilweise bereits anhand relativ kurzer Textabschnitte.

Die Forscher sehen solche Wasserzeichen unter anderem als Möglichkeit, automatisch erzeugte Inhalte, Fake News, Social-Media-Bots oder KI-generierte Arbeiten besser nachvollziehen zu können.

Ein Wasserzeichen ohne sichtbare Markierung

Bei Bildern oder Videos kennt man Wasserzeichen meist als sichtbares Logo oder als versteckte digitale Information. Bei Text funktioniert das schwieriger. Schon das Austauschen einzelner Wörter kann schließlich den Inhalt oder die Lesbarkeit verändern.

Das von den Forschern vorgeschlagene Verfahren setzt deshalb direkt bei der Token-Auswahl des Sprachmodells an.

Sprachmodelle erzeugen Texte nicht Wort für Wort im klassischen Sinne, sondern arbeiten mit sogenannten Tokens. Dabei kann es sich um vollständige Wörter, Wortbestandteile oder Zeichen handeln.

Bevor das Modell das nächste Token auswählt, wird sein verfügbares Vokabular pseudozufällig in zwei Gruppen eingeteilt:

Tokens aus der Green List erhalten bei der Textgenerierung eine leicht erhöhte Wahrscheinlichkeit. Das Modell wird also nicht gezwungen, bestimmte Wörter zu verwenden. Stattdessen wird es lediglich etwas stärker in Richtung bestimmter Tokens gelenkt.

Für einen Leser bleibt diese Veränderung normalerweise unsichtbar. Statistisch entsteht über einen längeren Text hinweg jedoch ein Muster.

Tauchen deutlich mehr Green-List-Tokens auf, als zufällig zu erwarten wären, spricht das dafür, dass der Text von einem entsprechend markierten Sprachmodell erzeugt wurde.

Der Kontext entscheidet über die nächste Green List

Ein wichtiger Bestandteil des Verfahrens ist, dass die Zuordnung nicht für den gesamten Text gleich bleibt.

Die Forscher verwenden den vorhergehenden Token als Grundlage für eine Hash-Funktion. Daraus wird anschließend bestimmt, welche Tokens beim nächsten Schritt zur Green List gehören.

Dadurch entsteht eine Art versteckte statistische Signatur innerhalb des Textes.

Der große Vorteil: Für die spätere Erkennung muss das ursprüngliche Sprachmodell nicht erneut ausgeführt werden.

Ein Prüfsystem benötigt weder die Modellparameter noch direkten Zugriff auf die KI selbst. Es muss lediglich die verwendete Methode beziehungsweise den entsprechenden Schlüssel kennen.

Damit könnten theoretisch auch externe Plattformen prüfen, ob Inhalte mit einem bestimmten KI-Wasserzeichen versehen wurden.

Ein statistischer Test entscheidet

Für die eigentliche Erkennung verwenden die Forscher einen sogenannten z-Score.

Der Algorithmus zählt, wie viele Tokens eines untersuchten Textes zur jeweils erwarteten Green List gehören. Anschließend wird berechnet, wie wahrscheinlich eine solche Verteilung bei einem nicht markierten Text wäre.

Je stärker der Anteil der Green-List-Tokens vom statistisch erwarteten Wert abweicht, desto höher ist der z-Score – und desto größer ist die Wahrscheinlichkeit, dass das Wasserzeichen vorhanden ist.

In einem Beispiel der Studie enthält ein markierter Text erheblich mehr Green-List-Tokens als statistisch zu erwarten wäre. Die Wahrscheinlichkeit, dass ein solches Ergebnis rein zufällig entsteht, liegt dort bei ungefähr 6 × 10⁻¹⁴.

Das entspricht einer extrem hohen statistischen Sicherheit.

Die Forscher schlagen beispielsweise einen Grenzwert von z > 4 vor. Unter den Annahmen ihres Modells entspricht dies einer theoretischen False-Positive-Wahrscheinlichkeit von ungefähr 3 × 10⁻⁵.

Damit soll verhindert werden, dass menschliche Texte leichtfertig als KI-generiert eingestuft werden.

„Soft Watermarking" soll die Textqualität erhalten

Eine einfache Variante des Verfahrens könnte dem Sprachmodell sämtliche Tokens der Red List komplett verbieten.

Das wäre zwar leicht zu erkennen, hätte allerdings einen entscheidenden Nachteil: Die Textqualität könnte deutlich leiden.

Die Forscher nennen als Beispiel vorhersehbare Wortfolgen. Auf „Barack" folgt in vielen Zusammenhängen mit sehr hoher Wahrscheinlichkeit „Obama". Würde „Obama" zufällig auf der Red List liegen, müsste das Modell stattdessen ein unpassenderes Wort wählen.

Deshalb schlagen die Wissenschaftler ein Soft Watermarking vor.

Dabei bleiben Red-List-Tokens weiterhin erlaubt. Tokens der Green List erhalten lediglich einen zusätzlichen Bonus in der Wahrscheinlichkeitsverteilung des Modells.

Das hat einen interessanten Effekt: Wenn mehrere Wörter gleichermaßen gut passen, kann das Wasserzeichen die Auswahl beeinflussen. Ist dagegen praktisch nur eine Fortsetzung sinnvoll, dominiert diese weiterhin.

Das Verfahren passt sich damit gewissermaßen automatisch an die Unsicherheit des Sprachmodells an.

Besonders gut funktioniert das Verfahren bei variablen Texten

Dieser Zusammenhang führt gleichzeitig zu einer wichtigen Einschränkung.

Bei Texten mit vielen möglichen Formulierungen – also hoher sogenannter Entropie – lässt sich das Wasserzeichen relativ stark in den Text integrieren.

Bei sehr vorhersehbaren Texten funktioniert das deutlich schlechter.

Ein Beispiel wären bekannte Zitate, repetitive Texte, Zahlenfolgen oder Programmcode mit einer nahezu festgelegten Struktur. Wenn das Modell kaum Auswahl zwischen mehreren sinnvollen Tokens hat, kann auch das Wasserzeichen die Generierung nur wenig beeinflussen.

Die Forscher beobachten in ihren Experimenten deshalb vor allem bei solchen Low-Entropy-Sequenzen falsch-negative Ergebnisse.

Mit anderen Worten: Ein Text kann mit einem Wasserzeichen erzeugt worden sein, ohne dass dieses anschließend stark genug nachweisbar ist.

Experimente zeigen hohe Erkennungsraten

Für ihre Versuche verwendeten die Forscher unter anderem Modelle aus Metas OPT-Familie.

Bei rund 200 Token langen Texten erreichte eine typische Konfiguration des Soft-Watermarks mit den Parametern γ = 0,5 und δ = 2 beim Schwellenwert z = 4 eine Erkennungsrate von 98,4 Prozent bei multinomialer Generierung.

Mit einer anderen Konfiguration mit γ = 0,25 und δ = 2 wurden 99,4 Prozent der markierten Texte erkannt.

Bei stärkeren Wasserzeichen stieg die Erkennungsrate weiter an.

Allerdings gibt es einen Zielkonflikt: Je stärker das Modell zur Green List gedrängt wird, desto einfacher lässt sich das Wasserzeichen erkennen – gleichzeitig kann sich aber die Qualität des erzeugten Textes verschlechtern.

Die Forscher untersuchen deshalb verschiedene Kombinationen aus Stärke und Größe der Green List.

Besonders interessant ist dabei Beam Search. In den Experimenten ließ sich damit teilweise ein stärkeres Wasserzeichen erzeugen, ohne die gemessene Textqualität im gleichen Umfang zu verschlechtern.

Kann man das Wasserzeichen einfach entfernen?

Eine entscheidende Frage lautet natürlich: Was passiert, wenn jemand weiß, dass ein Text ein Wasserzeichen enthält?

Die Forscher untersuchten deshalb verschiedene Angriffe.

Dazu gehören:

Auch eine zweite KI könnte verwendet werden, um Textabschnitte umzuschreiben.

In einem Experiment ließen die Wissenschaftler Teile der markierten Texte mit dem Sprachmodell T5-Large ersetzen.

Das Wasserzeichen ließ sich dadurch tatsächlich abschwächen. Allerdings mussten größere Teile des Textes verändert werden, um die Erkennung deutlich zu beeinträchtigen.

Bei einem Änderungsbudget von zehn Prozent sank die AUC der Erkennung beispielsweise nur von 0,998 auf 0,988. Bei stärkeren Veränderungen wurde das Wasserzeichen zunehmend schwieriger zu erkennen – gleichzeitig verschlechterte sich jedoch auch die gemessene Textqualität erheblich.

Das zeigt gleichzeitig eine grundsätzliche Grenze solcher Systeme: Ein Wasserzeichen kann robust gegen kleinere Änderungen sein, aber kein textbasiertes Verfahren kann verhindern, dass der Inhalt vollständig neu formuliert wird.

Kein allgemeiner KI-Detektor

Ein besonders wichtiger Punkt wird bei der Diskussion um KI-Wasserzeichen häufig übersehen:

Das Verfahren erkennt nicht grundsätzlich, ob irgendeine KI einen Text geschrieben hat.

Das Wasserzeichen muss bereits während der Textgenerierung eingebaut werden.

Ein Text von einem Sprachmodell ohne dieses Verfahren enthält deshalb auch kein entsprechendes Signal. Ebenso kann ein Mensch einen KI-generierten Text stark umschreiben oder lediglich dessen Ideen übernehmen.

Die Forscher weisen ausdrücklich darauf hin, dass ihr Wasserzeichen die konkrete Form beziehungsweise die Tokens des erzeugten Textes markiert – nicht dessen Bedeutung.

Ein völlig neuer Text, der beispielsweise lediglich auf einer von einer KI erstellten Gliederung basiert, wäre mit diesem Verfahren nicht nachweisbar.

Das unterscheidet Watermarking deutlich von klassischen KI-Detektoren, die versuchen, anhand des Schreibstils nachträglich zu schätzen, ob ein Text von einer Maschine stammt.

Öffentliche und private Wasserzeichen sind möglich

Interessant ist auch die Frage, wer das Wasserzeichen überprüfen darf.

Die Forscher beschreiben dafür zwei Varianten.

Bei einem öffentlichen Wasserzeichen könnte der Erkennungsalgorithmus frei verfügbar sein. So könnten beispielsweise soziale Netzwerke, Universitäten oder andere Plattformen Texte selbst überprüfen.

Alternativ könnte der Anbieter einen geheimen Schlüssel einsetzen und nur eine Schnittstelle zur Überprüfung bereitstellen.

Ein privates Verfahren erschwert Angreifern die gezielte Entfernung des Wasserzeichens, weil sie nicht wissen, welche Tokens zur Green beziehungsweise Red List gehören.

Denkbar wäre sogar eine Kombination aus beiden Varianten: ein öffentliches Wasserzeichen zur unabhängigen Überprüfung und ein zusätzliches geheimes Wasserzeichen für den Anbieter selbst.

Fazit: Wasserzeichen könnten KI-Texte nachvollziehbarer machen

Die Studie zeigt, dass sich statistische Wasserzeichen direkt in die Ausgabe großer Sprachmodelle integrieren lassen, ohne dafür ein Modell neu trainieren zu müssen.

Das Prinzip ist vergleichsweise einfach: Bestimmte Tokens werden während der Generierung subtil bevorzugt. Über viele Wörter hinweg entsteht dadurch ein Muster, das Menschen beim Lesen nicht bemerken, ein Algorithmus aber statistisch erkennen kann.

Die Experimente liefern vielversprechende Ergebnisse und zeigen, dass das Verfahren auch kleinere Änderungen am Text überstehen kann.

Eine universelle Lösung für die Erkennung von KI-Inhalten ist es jedoch nicht. Das Wasserzeichen muss vom jeweiligen Modellanbieter bewusst eingebaut werden, funktioniert bei stark vorhersehbaren Texten schlechter und kann durch umfangreiches Umschreiben irgendwann entfernt werden.

Trotzdem könnte die Technik langfristig ein wichtiger Baustein für mehr Transparenz bei generativer KI werden – insbesondere dann, wenn große Anbieter ihre Systeme standardmäßig mit überprüfbaren Wasserzeichen ausstatten.

Quelle: Kirchenbauer et al.: A Watermark for Large Language Models (ICML, 2023)

← Zurück zur Übersicht

Das könnte Sie auch interessieren