Zum Inhalt springenSkip to content
msm FortschrittsberichtProgress report
msm/Bildung mit KIAI in education/GenAI-Lernpenalty-Studie
Bildung · China / Schweden / Hongkong · Juli 2026

Der teuerste Abkürzungsweg: 26.000 Schüler zeigen, wann KI beim Lernen hilft — und wann sie schadet.

This article is currently available in German only — an English version will follow. Der Text liegt bisher nur auf Deutsch vor.

Zusammenfassung

Forschende der Universität Stockholm und der University of Hong Kong haben über 30 Monate die Leistungen von mehr als 26.000 Schülerinnen und Schülern in einem chinesischen Landkreis verfolgt — von September 2022 bis Juni 2025. Das Ergebnis ist unbequem und lehrreich zugleich: Wer generative KI für Hausaufgaben nutzte, verbesserte die Hausaufgabennoten um 18 % und brauchte 30 % weniger Zeit. Innerhalb von sechs Monaten sanken jedoch die Klassenarbeitsnoten um 20 %, und in den Abschlussprüfungen lagen die Nutzer 18 bis 24 % zurück. Der volle Effekt zeigte sich erst nach rund zwei Jahren. Die Studie liefert damit das, was der Debatte bislang fehlte: eine belastbare Antwort auf die Frage, unter welchen Bedingungen KI im Klassenzimmer nutzt.

Was wurde untersucht?

Die bisherige Forschung zu KI in der Bildung stützte sich überwiegend auf kurze, kontrollierte Experimente: ein Semester, ein Fach, ein sorgfältig gebautes Tutorsystem. Solche Studien — etwa die Harvard-Physikstudie oder die Khanmigo-Pilotauswertungen — kamen zu ermutigenden Ergebnissen und sind fachlich sauber. Sie beantworten aber eine eng gefasste Frage: Was passiert, wenn ein didaktisch durchdachtes System unter Aufsicht eingesetzt wird?

Die neue Untersuchung stellt eine andere Frage: Was passiert, wenn Jugendliche allgemeine KI-Assistenten unbeaufsichtigt für ihre Hausaufgaben verwenden — über Jahre? Dafür verfolgte das Team Hausaufgabennoten, Bearbeitungszeiten, monatliche Klassenarbeiten und schließlich die Aufnahmeprüfungen von über 26.000 Schülerinnen und Schülern der Sekundarstufe. Rund 80 Prozent gaben an, generative KI zu nutzen — am häufigsten Doubao, DeepSeek, ChatGLM, Ernie Bot und Qwen. Die Ergebnisse sind als CEPR-Diskussionspapier (DP21577) unter dem Titel „The Generative AI Learning Penalty" veröffentlicht.

Der Befund: schnell besser, langfristig schlechter

Die Kurzfristwirkung war eindeutig positiv. Hausaufgaben wurden schneller fertig und besser bewertet. Genau das ist der Effekt, den Eltern und Lehrkräfte im Alltag sehen — und der leicht als Lernerfolg missverstanden wird.

Die Langfristwirkung lief in die Gegenrichtung. Bereits nach sechs Monaten fielen die Ergebnisse in den unangekündigten Monatstests der KI-Nutzenden zurück. Der Abstand vergrößerte sich weiter, und die volle Wirkung zeigte sich erst in den Abschlussprüfungen nach etwa zwei Jahren. Die Erklärung liegt nahe: Die Hausaufgabe ist kein Bewertungsinstrument, sondern die Übung selbst. Wer den mühsamen Teil auslagert, produziert ein korrektes Ergebnis, aber keinen Lernprozess.

Die gemessene Größe war nie die Note auf dem Hausaufgabenblatt. Sie war das, was beim Ringen um die Lösung im Kopf entsteht — und genau das wird ausgelagert.

Wen es am stärksten trifft

  • Jüngere Jahrgänge. Je früher in der Sekundarstufe, desto größer der Nachteil — Grundlagen entstehen durch Wiederholung.
  • Leistungsstarke Schüler. Ein überraschender Befund: Gerade wer ohnehin gut ist, verliert am meisten, weil die eigene Anstrengung durch das Werkzeug am effizientesten ersetzt wird.
  • Gesellschaftswissenschaften vor MINT vor Sprachen. Am größten sind die Einbußen dort, wo Textproduktion und Argumentation die eigentliche Übung sind.

Die Zahlen im Überblick

Leistung KI-Nutzender — Nicht-Nutzende = 100
Hausaufgabennote / Monatstest nach 6 Monaten / Abschlussprüfung nach ca. 2 Jahren · Quelle: CEPR DP21577
26.811
beobachtete Schülerinnen und Schüler
30 Mon.
Beobachtungszeitraum (09/2022 – 06/2025)
≈ 2 Jahre
bis der volle Effekt messbar wird

Warum das eine gute Nachricht ist

Auf den ersten Blick liest sich die Studie als Warnung. Tatsächlich ist sie vor allem eine Präzisierung — und Präzision ist genau das, was diesem Feld gefehlt hat. Die Studie widerlegt nicht die positiven Ergebnisse der kontrollierten Tutor-Experimente. Sie zeigt, dass beide Befunde gleichzeitig wahr sein können, weil sie unterschiedliche Dinge messen:

  • Ein didaktisch gebautes Tutorsystem hält die kognitive Anstrengung beim Lernenden. Es stellt Rückfragen, gibt Hinweise statt Lösungen, erhöht die Schwierigkeit schrittweise. Solche Systeme zeigen in RCTs konsistent positive Effekte.
  • Ein allgemeiner Assistent ohne pädagogische Führung nimmt die Anstrengung ab. Das ist bei einer Arbeitsaufgabe erwünscht und bei einer Lernaufgabe schädlich.

Damit deckt sich die Studie mit dem OECD-Befund, wonach Lernende mit KI-Unterstützung Aufgaben deutlich erfolgreicher lösen, ohne Unterstützung aber schlechter abschneiden als zuvor. Die Botschaft ist nicht „KI raus aus der Schule", sondern: Es kommt auf die Bauart des Werkzeugs und den Ort seines Einsatzes an. Ein Tutor, der fragt, ist etwas anderes als ein Assistent, der antwortet.

Was daraus folgt

Für die Praxis lassen sich aus dem Befund recht konkrete Konsequenzen ableiten. Erstens: Hausaufgaben, die von einem Sprachmodell in Sekunden gelöst werden, messen nichts mehr und üben nichts mehr — sie müssen anders gestellt werden. Zweitens: Übungsphasen gehören dorthin, wo Aufgabenstellung und Anstrengung beobachtbar bleiben, also verstärkt in den Unterricht. Drittens: Wenn KI beim Üben eingesetzt wird, dann in einer Form, die zum Denken zwingt — erklären lassen, Zwischenschritte begründen, Fehler des Modells suchen.

Und viertens, methodisch: Die Studie zeigt, dass kurze Evaluationszeiträume in diesem Feld systematisch in die Irre führen können. Ein Programm, das nach einem Halbjahr glänzend aussieht, kann nach zwei Jahren negativ bilanzieren. Jede Bildungspolitik, die KI-Werkzeuge flächendeckend einführt, sollte entsprechend lange messen.

Was bleibt offen?

Die Untersuchung ist eine Beobachtungsstudie, kein randomisiertes Experiment — die Zuordnung zur KI-Nutzung erfolgte nicht zufällig, sondern durch die Schüler selbst. Die Autoren vergleichen Nutzende und Nicht-Nutzende und kontrollieren für beobachtbare Unterschiede, aber ein Restrisiko der Selbstselektion bleibt. Der Kontext ist zudem spezifisch: ein Landkreis in Zentralchina, ein stark prüfungszentriertes Schulsystem, ein bestimmter Satz an KI-Werkzeugen. Ob sich die Größenordnung auf deutsche Schulen übertragen lässt, ist offen. Die Richtung des Effekts — kurzfristiger Gewinn, langfristiger Verlust bei ausgelagerter Übung — ist dagegen theoretisch gut begründet und deckt sich mit dem, was die Lernforschung über Abrufübung und wünschenswerte Erschwernisse seit Langem weiß.

Original-Quellen

Mehr direkt bei CEPR (Diskussionspapier DP21577)

Quellen

  1. CEPR — DP21577: The Generative AI Learning Penalty: Evidence from Chinese Secondary Education: cepr.org
  2. South China Morning Post — AI homework tools cut exam scores by 20%, study of 26,000 Chinese students finds: scmp.com
  3. The Decoder — A 26,000-student study shows AI's hidden learning cost takes two full years to surface: the-decoder.com
  4. Psychology Today — A Study of 26,000 Students Shows the AI Learning Trap: psychologytoday.com
  5. Scientific Reports — AI tutoring outperforms in-class active learning: an RCT (Gegenbefund kontrollierter Systeme): nature.com