NVIDIA GR00T N2: ein Weltmodell, das den Humanoiden als Grundform denkt.
This article is currently available in German only — an English version will follow. Der Text liegt bisher nur auf Deutsch vor.
Auf der GTC 2026 hat NVIDIA GR00T N2 vorgestellt — ein generalistisches KI-Modell für humanoide Roboter mit 30+ Bewegungsfreiheitsgraden und Ganzkörper-Steuerung. GR00T N2 gilt als das erste großformatige Vision-Language-Action-Modell (VLA), das die humanoide Bauform als primäres Designprinzip behandelt statt als Sonderfall. Kern ist eine „World-Action"-Architektur: Das Modell sagt nicht nur die nächste Aktion voraus, sondern auch, wie die Welt danach wahrscheinlich aussehen wird. Damit rückt eine gemeinsame KI-Grundlage näher, auf der viele verschiedene Roboterkörper laufen können.
Was ist passiert?
Humanoide Roboter hatten lange ein Software-Problem: Für jede neue Aufgabe und jeden neuen Körper musste das Steuerungssystem mühsam neu trainiert werden. Vision-Language-Action-Modelle (VLA) ändern das. Sie verbinden Sehen, Sprache und Handeln in einem einzigen neuronalen Netz — ähnlich wie große Sprachmodelle Text — und lassen sich mit vergleichsweise wenig Zusatzdaten auf neue Aufgaben anpassen. Auf der GTC 2026 stellte NVIDIA mit GR00T N2 die nächste Stufe seiner GR00T-Reihe vor.
Das Besondere: GR00T N2 ist ausdrücklich für die humanoide Form gebaut — für Systeme mit mehr als 30 Freiheitsgraden und voller Ganzkörper-Kontrolle. Bisherige VLA-Modelle behandelten Beine, Arme und Rumpf eher als Anhängsel eines auf Greifarme ausgelegten Systems. GR00T N2 kehrt das um. Dazu kommt die „World-Action"-Architektur: Das Modell prognostiziert nicht nur den nächsten Handgriff, sondern auch die erwartete nächste Beobachtung — also den Zustand der Welt nach dieser Aktion. Ein solches inneres Weltmodell erlaubt vorausschauendes, stabileres Handeln.
Warum das eine positive Entwicklung ist
Eine gemeinsame KI-Grundlage verändert, wie schnell Robotik voranschreitet:
- Ein Modell, viele Körper. Wenn dieselbe Basis auf unterschiedlichen Humanoiden läuft, muss nicht jeder Hersteller bei null anfangen — Fortschritte kommen allen zugute.
- Vorausschauend statt reaktiv. Ein inneres Weltmodell lässt Roboter die Folgen ihrer Handlungen abschätzen, bevor sie sie ausführen — das macht sie sicherer im Umgang mit Menschen und zerbrechlichen Dingen.
- Schnellere Anpassung. Wie bei Sprachmodellen genügt oft ein kleines Nachtraining, um eine neue Aufgabe zu lernen, statt monatelanger Spezialentwicklung.
- Vom Demo- zum Dauerbetrieb. Robustere Steuerung ist die Voraussetzung dafür, dass Humanoide mehrstündige Schichten zuverlässig durchhalten.
Das VLA-Feld in Zahlen
Wo GR00T N2 im Feld steht
2026 ist das Jahr, in dem VLA-Modelle vom Forschungsobjekt zum Produktionswerkzeug wurden. Modelle wie π0, Gemini Robotics, Helix und die erste GR00T-Generation steuern bereits reale Humanoide; UnifoLM-VLA-0 baut auf ähnlichen Grundlagen auf. In der Praxis laufen Figure-Roboter mit dem Helix-Modell und Teslas Optimus mit internen VLAs mehrstündige Schichten an Fahrzeug-Baugruppen, während 1X NEO in ersten Testhaushalten Wäsche zusammenlegt. GR00T N2 zielt darauf, diese Fähigkeiten auf eine breitere, herstellerübergreifende Basis zu stellen — mit dem Weltmodell als entscheidender Neuerung.
„Der Durchbruch der Humanoiden entscheidet sich nicht an der Mechanik, sondern an der Software, die sie steuert."
Was bleibt offen?
Zwischen beeindruckender Demo und verlässlichem Alltag liegt weiterhin eine große Lücke. Ein Weltmodell ist nur so gut wie die Daten, mit denen es trainiert wurde — und Trainingsdaten für vielfältige, unstrukturierte Umgebungen sind knapp. Sicherheit im direkten Kontakt mit Menschen, Rechenaufwand an Bord des Roboters und die Frage, wie gut sich ein Modell wirklich von einem Körper auf einen anderen übertragen lässt, sind offen. Klar ist aber die Richtung: Weg von spezialisierten Insellösungen, hin zu gemeinsamen KI-Grundlagen, auf denen die gesamte Branche aufbauen kann.
Original-Quellen
Mehr lesen im NVIDIA Technical Blog und im State of Robotics 2026.
Quellen
- NVIDIA Technical Blog — Pretrained to Imagine, Fine-Tuned to Act: The Rise of World-Action Models: developer.nvidia.com
- Robotics Center of Silicon Valley — State of Robotics 2026 Report: $38B Market, 12 Humanoids, VLA Adoption: roboticscenter.ai
- Humanoid.guide — UnifoLM-VLA-0 – Foundation Model for General-Purpose Control: humanoid.guide
- GlobeNewswire — Embodied AI Robot Large Model (Including VLA) Research Report 2026: globenewswire.com
← Alle Entwicklungen im Bereich← All developments in this area