Der KI-Tutor war einen Klick entfernt — und die meisten haben nicht geklickt.
This article is currently available in German only — an English version will follow. Der Text liegt bisher nur auf Deutsch vor.
Die Ökonomen Philip Oreopoulos (University of Toronto) und Nina Low haben in 18 Mittelschulen in Hamilton County, Tennessee zwei Schuljahre lang untersucht, was passiert, wenn Schülerinnen und Schüler in ihren täglichen Mathe-Förderstunden Khan Academy mit dem KI-Tutor Khanmigo nutzen — eingestellt als Coach, der keine Lösungen verrät. Ergebnis der als NBER Working Paper 35620 veröffentlichten Studie: Die Zuweisung hob die Mathematikleistung um 1,3 nationale Perzentilränge pro Halbjahr, etwa 0,06 bis 0,08 Standardabweichungen pro Schuljahr. Das ist messbar, entspricht aber ungefähr dem Effekt von Khan-Academy-Übungen ohne KI. Der Grund liegt im Nutzungsverhalten: 96 Prozent probierten Khanmigo aus, doch der mittlere Schüler schrieb dem Tutor nur an einem Drittel seiner Übungstage — und bei nur 17 Prozent der Sitzungen, in denen er einen Fehler machte.
Was wurde untersucht?
Die Studie ist eine der ersten großen, vorregistrierten Cluster-Randomisierungen zu generativer KI im regulären Schulbetrieb. Der Schulbezirk Hamilton County — er umfasst die Stadt Chattanooga — hatte bereits tägliche Förderstunden in Mathematik („remedial math sessions") eingerichtet. Innerhalb dieser Stunden wurden Schülerinnen und Schüler per Zufall der Nutzung von Khan Academy mit Khanmigo zugeteilt oder nicht. Khanmigo war so konfiguriert, dass es Hinweise gibt, Rückfragen stellt und Rechenwege erklärt, aber keine fertigen Antworten liefert.
Gemessen wurde mit den standardisierten Halbjahrestests des Bezirks, deren Ergebnisse auf nationale Perzentilränge abgebildet werden. Die Studie ist im AEA-RCT-Register unter AEARCTR-0013519 vorregistriert, wurde von J-PAL, der Smith Richardson Foundation sowie den kanadischen Forschungsräten SSHRC und NSERC finanziert und ist seit dem 17. August 2026 als Arbeitspapier des National Bureau of Economic Research verfügbar. Im September griffen Bildungsmedien und Politik das Papier auf — unter anderem, weil in North Carolina gerade über eine Zehn-Millionen-Dollar-Finanzierung für Khanmigo an Schulen des Bundesstaats gestritten wird.
Effektgrößen im Vergleich
Warum der Effekt klein blieb
Die Autoren haben die Nutzungsprotokolle ausgewertet, und das Bild ist eindeutig. Der Tutor stand jederzeit zur Verfügung, wurde aber selten und oberflächlich genutzt. Die meisten Nachrichten, die Schüler schrieben, waren nackte Zahlenantworten oder Klicks auf vorgeschlagene Fragen; ein substanzielles mathematisches Gespräch — „Warum ist das falsch?", „Wie kommt man auf diesen Schritt?" — kam selten zustande. Selbst nach einem Fehler, also genau dann, wenn ein Tutor am meisten hilft, blieb das Chatfenster in fünf von sechs Fällen leer.
Wenn Schüler den Tutor aber ansprachen, half er: Die Trefferquote bei der jeweils nächsten Aufgabe stieg messbar. Auf einen Kurztest eine Woche später übertrug sich das allerdings nur schwach und statistisch unsicher. Der Engpass, so die Autoren, ist nicht die Qualität der KI, sondern die Bereitschaft, sie zu benutzen.
„Die bindende Beschränkung scheint das Engagement zu sein: Das Versprechen von KI-Tutoring einzulösen wird erfordern, dass Schüler es benutzen — nicht nur, dass man ihnen Zugang gibt." — Oreopoulos und Low, NBER Working Paper 35620
Einordnung: Ein realistisches Bild, kein Verriss
Die Studie widerspricht der Erzählung vom persönlichen Tutor für jedes Kind, der Lernkurven verdoppelt — und sie widerspricht ebenso der Gegenerzählung, KI im Klassenzimmer bringe nichts. Ein Zuwachs von 0,06 bis 0,08 Standardabweichungen pro Jahr für eine Maßnahme, die keinen zusätzlichen Lehrer und keine zusätzliche Unterrichtszeit kostet, ist in der Bildungsforschung ein respektabler, wenn auch kein spektakulärer Wert. Er liegt in der Größenordnung dessen, was frühere Studien für Khan Academy ohne KI fanden — der Tutor hat also nicht geschadet, aber auch nicht den Unterschied gemacht.
Das Papier passt zu den Beobachtungen, die msm in den vergangenen Monaten dokumentiert hat: Chalkbeat berichtete im Juni, dass mehrere KI-Tutoring-Studien am selben Problem scheiterten — die Schüler nutzten das Werkzeug zu selten, um einen Effekt messen zu können. Sal Khan selbst räumte ein, Khanmigo sei für viele Schüler „ein Non-Event" gewesen. Und die Oreopoulos-Studie zum Bruchrechnen vom August zeigte, dass die Kombination aus KI-Hinweisen und erzwungener Wiederholung besser wirkt als KI allein. Die Lehre aus allen drei: Das Design der Nutzung entscheidet, nicht das Modell.
Was bleibt offen?
Erstens die Frage der Nutzungsanreize. Die Studie zeigt, dass freiwillige Nutzung nicht reicht; ob verpflichtende Interaktion — etwa ein Tutor, der nach jedem Fehler von sich aus nachfragt — die Effekte hebt, ohne die Schüler zu nerven, ist unerforscht. Zweitens die Übertragbarkeit: Förderstunden für leistungsschwächere Mittelschüler sind ein besonderes Setting; Oberstufenschüler oder Studierende gehen mit einem Chatbot vermutlich anders um. Und drittens die Frage, ob 0,14 Standardabweichungen für aktive Nutzer ein Deckel oder ein Anfang sind. Khanmigo hat sich seit dem Studienbeginn 2024 mehrfach verändert; die getestete Version ist nicht die aktuelle.
Original-Quellen
Arbeitspapier: nber.org/papers/w35620
Quellen
- Philip Oreopoulos, Nina Low — One Click Away: AI Tutoring with Khanmigo in a Two-Year School Experiment, NBER Working Paper 35620, August 2026: nber.org
- EdWorkingPapers — AI Tutoring with Khanmigo in a Two-Year School Experiment (Volltext PDF): edworkingpapers.com
- AEA RCT Registry — AI-Powered Tutoring: Unleashing the Full Potential of Personalized Learning with Khanmigo, AEARCTR-0013519: socialscienceregistry.org
- J-PAL — AI-Powered Tutoring: Unleashing the Full Potential of Personalized Learning with Khanmigo: povertyactionlab.org
- Chalkbeat — Does AI tutoring work? Students would have to use it for researchers to find out, 17. Juni 2026: chalkbeat.org
- Brookings — What the research shows about generative AI in tutoring: brookings.edu
- Khan Academy Blog — How Khan Academy Is Building a Better AI Tutor: Our Most Recent Learnings: blog.khanacademy.org
- Pursuit — Latest AI in Education News and Policies, Aug–Sept 2026 (North Carolina, Senate Bill 1006): pursuit.us
← Alle Entwicklungen im Bereich← All developments in this area