Studie: Menschen können KI-Geschichten kaum von menschlichen Texten unterscheiden
Veröffentlicht am 06.08.2026
Ist eine Kurzgeschichte von einem Menschen geschrieben – oder stammt sie von ChatGPT? Für viele Leser ist diese Frage offenbar deutlich schwieriger zu beantworten als gedacht. Eine 2026 veröffentlichte Studie von Sydney Sears und Deena Skolnick Weisberg von der Villanova University kommt zu einem bemerkenswerten Ergebnis: Die Teilnehmer konnten KI-generierte und menschliche Geschichten nicht zuverlässig auseinanderhalten. Teilweise wurden die KI-Texte sogar besser bewertet.
KI-Geschichten schneiden überraschend gut ab
Für die Untersuchung verwendeten die Forscherinnen drei von Menschen geschriebene Kurzgeschichten sowie drei entsprechende Geschichten, die mit ChatGPT 4.0 erzeugt wurden. Die Texte waren jeweils ungefähr 1.000 Wörter lang.
In der ersten Studie nahmen 1.682 Personen teil. Sie bekamen entweder eine menschliche oder eine KI-generierte Geschichte zu lesen. Gleichzeitig wurde ihnen gesagt, der Text stamme entweder von einem Menschen oder von ChatGPT – wobei diese Information nicht zwangsläufig der Wahrheit entsprach.
Das Ergebnis dürfte manche überraschen: Die tatsächlich von ChatGPT erzeugten Geschichten wurden im Durchschnitt sowohl hinsichtlich ihrer Qualität als auch ihrer Wirkung auf die Leser besser bewertet als die menschlichen Texte.
Gleichzeitig zeigte sich allerdings ein deutlicher Vorbehalt gegenüber künstlicher Intelligenz: Wurde den Teilnehmern gesagt, eine Geschichte sei von einem Menschen geschrieben worden, bewerteten sie diese besser – unabhängig davon, wer sie tatsächlich geschrieben hatte.
Anders gesagt: Die Leser mochten teilweise die KI-Texte lieber, bewerteten sie aber schlechter, sobald sie glaubten, dass eine KI dahintersteckt.
Mensch oder KI? Die Trefferquote ist kaum besser als Raten
Noch interessanter wurden die Ergebnisse der beiden folgenden Experimente.
Hier erhielten die Teilnehmer jeweils zwei Geschichten: eine von einem Menschen und eine von ChatGPT. Anschließend mussten sie entscheiden, welcher Text von wem stammte.
In Studie 2 mit 424 Teilnehmern identifizierten lediglich 39,4 Prozent die Herkunft der Geschichten korrekt. Die Teilnehmer lagen damit sogar signifikant unter dem statistischen Zufallswert von 50 Prozent.
In Studie 3 mit weiteren 481 Personen waren 52 Prozent der Antworten richtig. Dieser Wert unterschied sich statistisch nicht vom Zufall.
Über beide Experimente hinweg zeigt sich damit recht deutlich: Menschen besitzen offenbar kein zuverlässiges Gespür dafür, ob eine kurze fiktionale Geschichte von ChatGPT oder einem menschlichen Autor stammt.
KI-Erfahrung hilft – Literaturkenntnis erstaunlicherweise nicht
Interessant ist auch, wer bei der Unterscheidung erfolgreicher war.
Teilnehmer mit mehr Erfahrung im Umgang mit KI-Systemen beziehungsweise höherer selbst eingeschätzter KI-Kompetenz erkannten die Herkunft der Texte häufiger korrekt.
Erfahrung mit Literatur hatte dagegen keinen vergleichbaren Effekt. Personen, die viel Belletristik lesen, schreiben oder analysieren, waren nicht automatisch besser darin, KI-Texte zu erkennen.
Auch vermeintlich typische Merkmale erwiesen sich teilweise als schlechte Hinweise. Wer sich beispielsweise stark auf die Sprache eines Textes konzentrierte, lag in den Experimenten sogar häufiger daneben.
Noch kein Beweis für den KI-Roman
Die Ergebnisse haben allerdings klare Grenzen. Untersucht wurden lediglich kurze Geschichten von ungefähr 1.000 Wörtern und ausschließlich realistische fiktionale Texte. Ob eine KI auch einen kompletten Roman mit langfristiger Charakterentwicklung und komplexer Handlung auf vergleichbarem Niveau schreiben könnte, wurde nicht untersucht.
Zudem basierten die KI-Geschichten auf ChatGPT 4.0 und die Teilnehmer stammten aus den USA.
Trotzdem liefert die Studie einen interessanten Einblick in die aktuelle Entwicklung generativer KI: Zumindest bei kurzen Geschichten scheint die Grenze zwischen menschlichem und maschinellem Schreiben für normale Leser bereits erstaunlich schwer erkennbar zu sein.
Und möglicherweise ist inzwischen nicht mehr die Frage entscheidend, ob wir einen KI-Text erkennen können – sondern warum wir ihn anders bewerten, sobald wir wissen, dass er von einer KI stammt.
Quelle: Sears & Weisberg: Bot or not? (Judgment and Decision Making, 2026)