Claude kennzeichnet KI-Texte mit unsichtbaren Wasserzeichen und C2PA-Metadaten
Veröffentlicht am 11.08.2026
Anthropic will KI-generierte Inhalte von Claude künftig besser maschinell erkennbar machen. Dafür setzt das Unternehmen auf zwei unterschiedliche Verfahren: unsichtbare Wasserzeichen direkt in generierten Texten und signierte Herkunftsinformationen bei Dateien wie Bildern. Hintergrund sind unter anderem neue Transparenzanforderungen durch den europäischen AI Act.
Anthropic hat nach eigenen Angaben den Code of Practice zu Artikel 50(2) des EU AI Acts unterzeichnet. In einer aktualisierten Hilfeseite erklärt das Unternehmen nun, wie entsprechende Kennzeichnungen bei Claude umgesetzt werden sollen und welche Ansätze dafür vorgesehen sind.
Unsichtbares Wasserzeichen direkt im Text
Bei unterstützten Claude-Modellen soll beim Generieren eines Textes ein nicht sichtbares Wasserzeichen direkt in den Inhalt eingebettet werden.
Für den Leser soll sich dadurch nichts verändern. Laut Anthropic beeinflusst die Markierung weder die Bedeutung noch die Qualität oder Lesbarkeit der Antwort. Das Wasserzeichen befindet sich stattdessen in einer Form im Text, die sich maschinell untersuchen lässt.
Ein entscheidender Vorteil dieses Ansatzes: Die Kennzeichnung ist Bestandteil des eigentlichen Textes. Wird eine Claude-Antwort beispielsweise kopiert und auf einer Webseite, in einem Dokument oder in einer anderen Anwendung eingefügt, kann das Wasserzeichen mit übertragen werden.
Anthropic erklärt außerdem, dass die Markierung bestimmte nachträgliche Änderungen am Text überstehen kann. Wie widerstandsfähig das eigene Verfahren gegenüber umfangreichen Überarbeitungen, Umschreibungen oder Übersetzungen ist, beschreibt das Unternehmen bislang allerdings nicht im Detail.
Wie können unsichtbare Wasserzeichen in KI-Texten funktionieren?
Anthropic hat bislang nicht öffentlich erklärt, welches technische Verfahren Claude konkret für das Text-Wasserzeichen verwendet. Einen Eindruck davon, wie statistische Wasserzeichen für Sprachmodelle grundsätzlich funktionieren können, liefert jedoch ein bereits bekanntes Forschungsverfahren, das von Wissenschaftlern der University of Maryland untersucht wurde.
Das Prinzip setzt direkt bei der Auswahl der sogenannten Tokens an, aus denen ein Sprachmodell seinen Text zusammensetzt. Vereinfacht gesagt wird das verfügbare Vokabular während der Generierung pseudozufällig in zwei Gruppen aufgeteilt: eine Green List und eine Red List. Tokens aus der Green List erhalten eine leicht erhöhte Wahrscheinlichkeit, vom Modell ausgewählt zu werden.
Das Sprachmodell wird dabei nicht gezwungen, bestimmte Wörter zu verwenden. Vielmehr wird die Wahrscheinlichkeitsverteilung nur leicht verändert. Für Menschen bleibt dies beim Lesen praktisch unsichtbar. Über einen längeren Text hinweg entsteht allerdings ein statistisches Muster: Treten deutlich mehr Green-List-Tokens auf, als zufällig zu erwarten wäre, kann ein entsprechender Algorithmus dies erkennen.
Für die eigentliche Überprüfung kann beispielsweise ein statistischer z-Score berechnet werden. Je stärker die Zahl der erwarteten Green-List-Tokens vom Zufallswert abweicht, desto deutlicher ist das Signal eines möglichen Wasserzeichens.
Der Vorteil eines solchen Ansatzes liegt darin, dass die Markierung bereits während der Textgenerierung entsteht und nicht erst nachträglich an einen fertigen Text angehängt wird.
Kleinere Änderungen, das Austauschen einzelner Wörter oder begrenztes Umschreiben müssen ein solches statistisches Signal nicht sofort zerstören. Umfangreiches Paraphrasieren oder eine vollständige Neuformulierung kann die Erkennung dagegen zunehmend erschweren.
Wichtig: Daraus lässt sich nicht ableiten, dass Claude genau dieses Green-/Red-List-Verfahren verwendet. Anthropic bestätigt derzeit lediglich, dass unterstützte Claude-Modelle ein nicht sichtbares Wasserzeichen direkt in generierten Text einbetten. Details zum eigenen Markierungs- und Erkennungsverfahren sollen erst mit weiterer technischer Dokumentation veröffentlicht werden.
Eine ausführlichere Erklärung der Funktionsweise statistischer Text-Wasserzeichen gibt es im Artikel „Forscher zeigen neue Erkennungsmethode für KI-Texte mit unsichtbaren Wasserzeichen" auf KI TechNews.
Wasserzeichen soll direkt auf Modellebene entstehen
Technisch besonders relevant ist, dass Anthropic die Kennzeichnung nicht lediglich über eine einzelne Claude-Anwendung hinzufügen möchte.
Die Wasserzeichen sollen auf Modellebene eingebettet werden. Laut Anthropic bedeutet das, dass die Markierung unabhängig davon vorhanden sein kann, über welches Claude-Produkt oder welche Oberfläche ein unterstütztes Modell seinen Text erzeugt.
Das unterscheidet diesen Ansatz von einfachen Metadaten, die eine Anwendung nachträglich an einen Inhalt anhängen könnte. Solche Zusatzinformationen können beim Kopieren eines Textes schnell verloren gehen. Ein direkt in die Textgenerierung eingebettetes Signal reist dagegen gewissermaßen mit dem Inhalt mit.
C2PA-Metadaten für Bilder und andere Dateien
Bei generierten Dateien verfolgt Anthropic einen anderen Ansatz. Unterstützte Dateitypen wie SVG-, PNG- und JPG-Dateien sollen mit signierten Herkunftsinformationen versehen werden.
Dafür setzt Anthropic auf den offenen Industriestandard C2PA – Coalition for Content Provenance and Authenticity.
C2PA dient dazu, Informationen über Herkunft und Bearbeitung digitaler Inhalte mit signierten Metadaten zu versehen. Bei einer von Claude verarbeiteten Datei kann eine solche Kennzeichnung darauf hinweisen, dass Claude an der Verarbeitung beteiligt war. Laut Anthropic soll sich anhand der Signatur außerdem feststellen lassen, ob eine entsprechend gekennzeichnete Datei nachträglich manipuliert wurde.
Damit verfolgt Anthropic bei Text und Dateien zwei unterschiedliche Strategien:
- Texte: Das Wasserzeichen wird unsichtbar direkt in den generierten Text eingebettet.
- Unterstützte Dateien: Herkunftsinformationen werden über signierte C2PA-Metadaten hinterlegt.
Erkennung der Claude-Wasserzeichen soll ebenfalls möglich werden
Ein Wasserzeichen ist allerdings nur dann wirklich hilfreich, wenn es anschließend auch überprüft werden kann.
Anthropic arbeitet deshalb nach eigenen Angaben an Möglichkeiten, mit denen Nutzer und externe Anbieter die eingebetteten Wasserzeichen und Herkunftsmetadaten erkennen können.
Ein entsprechender Test soll prüfen, ob ein Text oder eine Datei eine unterstützte Claude-Kennzeichnung enthält.
Wichtig ist dabei die vorsichtige Formulierung von Anthropic: Wird eine solche Markierung erkannt, deutet dies darauf hin, dass der betreffende Inhalt möglicherweise von Claude verarbeitet wurde. Die Kennzeichnung ist damit nicht automatisch ein Beweis dafür, dass der komplette Inhalt unverändert von Claude erstellt wurde.
Konkrete technische Informationen zu den Erkennungsverfahren hat Anthropic bislang noch nicht veröffentlicht. Eine ausführlichere technische Dokumentation soll folgen.
Kein klassischer KI-Detektor
Der Ansatz unterscheidet sich grundlegend von vielen sogenannten KI-Detektoren.
Klassische Erkennungssysteme versuchen häufig, einen bereits vorhandenen Text anhand sprachlicher oder statistischer Eigenschaften nachträglich als menschlich oder KI-generiert einzustufen.
Ein Wasserzeichen verfolgt dagegen ein anderes Prinzip: Das KI-Modell hinterlässt bereits während der Generierung ein gezielt eingebautes Signal.
Genau darin liegt allerdings auch eine wichtige Einschränkung. Ein solches Verfahren kann nicht automatisch jeden beliebigen KI-Text erkennen. Das entsprechende Wasserzeichen muss bereits bei der Erzeugung des Textes eingebaut worden sein. Auch das von Forschern untersuchte Green-/Red-List-Verfahren ist deshalb ausdrücklich kein universeller KI-Detektor.
Wurde ein Text von einem anderen Modell ohne entsprechendes Wasserzeichen erstellt oder später vollständig neu formuliert, kann ein auf dieses spezifische Signal ausgelegter Detektor den ursprünglichen KI-Ursprung nicht zwangsläufig feststellen.
Wie robust sind solche Wasserzeichen?
Eine der entscheidenden Fragen wird sein, wie gut sich die Markierungen gegenüber nachträglichen Veränderungen behaupten können.
Bei dem in der Forschung untersuchten statistischen Wasserzeichen wurden unter anderem das Einfügen und Löschen von Tokens, der Austausch einzelner Wörter, automatisches Paraphrasieren sowie weitere Manipulationen getestet. Die Ergebnisse zeigen, dass kleinere Veränderungen das Signal nicht zwangsläufig sofort entfernen. Bei umfangreicheren Änderungen wird die Erkennung jedoch zunehmend schwieriger.
Genau hier dürfte auch bei Claude ein wichtiger Punkt liegen: Ein unsichtbares Wasserzeichen muss stark genug sein, um zuverlässig erkannt zu werden, darf gleichzeitig aber die Qualität und Natürlichkeit des erzeugten Textes möglichst nicht beeinträchtigen.
Wie Anthropic diesen Zielkonflikt technisch löst, ist bislang nicht bekannt.
Mehr Transparenz für KI-generierte Inhalte
Die Entwicklung ist vor allem deshalb interessant, weil sich KI-generierte Texte immer schwerer allein anhand ihrer Sprache von menschlich geschriebenen Inhalten unterscheiden lassen.
Statt einen Text nachträglich danach zu beurteilen, ob er „nach KI klingt", könnten Wasserzeichen einen anderen Weg ermöglichen: Das Modell selbst hinterlässt bei der Generierung eine überprüfbare Spur.
Das könnte beispielsweise Plattformen, Unternehmen oder andere Dienste dabei unterstützen, KI-generierte Inhalte besser nachvollziehbar zu machen.
Die Forschung zeigt jedoch gleichzeitig, dass solche Systeme keine perfekte Lösung darstellen. Die Zuverlässigkeit hängt unter anderem von der Länge und Art des Textes sowie von möglichen nachträglichen Veränderungen ab. Zudem muss das jeweilige Modell das Wasserzeichen überhaupt unterstützen.
Auch Entwickler müssen den EU AI Act beachten
Für Unternehmen und Entwickler, die Claude in eigene Anwendungen integrieren, enthält Anthropic noch einen wichtigen Hinweis.
Sie müssen selbst prüfen, welche Anforderungen aus Artikel 50 des EU AI Acts für ihre jeweiligen Produkte und Dienste gelten. Die von Anthropic bereitgestellten Kennzeichnungen entbinden Anbieter also nicht automatisch von ihren eigenen Transparenzpflichten.
Anthropic möchte Entwickler mit seinen Markierungs- und Erkennungsverfahren dabei unterstützen und kündigt weitere technische Informationen an.
Fazit
Anthropic bereitet Claude damit auf eine Zukunft vor, in der sich KI-generierte Inhalte zunehmend auch maschinell als solche kennzeichnen lassen.
Bei Texten setzt das Unternehmen auf unsichtbare Wasserzeichen, die direkt während der Generierung auf Modellebene eingebettet werden und beim Kopieren erhalten bleiben sowie teilweise auch Bearbeitungen überstehen können. Bei unterstützten Bildern und anderen Dateien sollen dagegen signierte C2PA-Herkunftsdaten zum Einsatz kommen.
Wie das Text-Wasserzeichen von Claude technisch genau funktioniert, bleibt vorerst offen. Forschungsarbeiten zeigen jedoch bereits, wie sich durch eine subtile Bevorzugung bestimmter Tokens statistische Signaturen erzeugen lassen, die für Menschen unsichtbar bleiben, von einem Algorithmus aber erkannt werden können.
Entscheidend wird nun sein, wie robust Anthropic seine eigene Lösung gegenüber Bearbeitungen gestaltet und wie zuverlässig externe Dienste die Kennzeichnungen überprüfen können. Genau zu diesen technischen Details will das Unternehmen künftig weitere Informationen veröffentlichen.