Zum Inhalt springenSkip to content
msm FortschrittsberichtProgress report
msm/RobotikRobotics/Xiaomi-Robotics-1
Robotik · China · August 2026Robotics · China · August 2026

Hunderttausend Stunden Handarbeit — und alles offen. A hundred thousand hours of handwork — released openly.

ZusammenfassungSummary

Xiaomi hat am 5. August 2026 sein Vision-Language-Action-Basismodell Xiaomi-Robotics-1 samt Code und Checkpoints auf GitHub und Hugging Face veröffentlicht; das Paper erschien am 16. Juli auf arXiv. Vortrainiert wurde es mit über 100.000 Stunden realer Manipulationsdaten aus rund 1.700 Umgebungen, 2,4 Millionen Episoden und mehr als 260 Aufgabentypen. Der eigentliche Kniff steckt in der Datenerhebung: Statt teurer Teleoperation echter Roboter nutzte Xiaomi handgeführte Greifer mit Kamera.

On 5 August 2026 Xiaomi released its vision-language-action foundation model Xiaomi-Robotics-1 with code and checkpoints on GitHub and Hugging Face; the paper appeared on arXiv on 16 July. It was pretrained on more than 100,000 hours of real manipulation data across roughly 1,700 environments, 2.4 million episodes and over 260 task types. The real trick is in data collection: instead of costly teleoperation of real robots, Xiaomi used handheld grippers with a camera.

Was ist passiert?What happened?

Der Engpass beim Training von Robotern ist nicht Rechenleistung, sondern Daten. Sprachmodelle lernen aus Text, den es im Netz umsonst gibt; Roboter brauchen Bewegungsdaten, und die entstehen bislang meist durch Teleoperation — ein Mensch steuert einen echten Roboter, Stunde um Stunde. Das ist langsam und teuer.

Xiaomi hat den Zwischenschritt weggelassen. Menschen zeichneten Handgriffe mit handgeführten UMI-Greifern samt Kamera direkt auf — in Küchen, Büros, Läden, Fabriken und im Freien. Kein Roboter musste dafür bereitstehen. Die Beschriftung des kompletten Datensatzes übernahm eine automatische Pipeline und dauerte laut Xiaomi etwa zwei Wochen.

Danach folgte ein Post-Training mit über 10.000 Stunden Cross-Embodiment-Daten auf echten Robotern — mobile Manipulatoren und Doppelarmsysteme. Architektonisch kombiniert XR-1 ein Qwen3-VL-Backbone mit einem Diffusion Transformer in einer Mixture-of-Transformers-Konfiguration; es existiert in den Größen 2, 5 und 10 Milliarden Parameter.

Was die Benchmarks zeigenWhat the benchmarks show

  • RoboCasa365: 57,6 Prozent Erfolgsquote gegenüber 46,6 Prozent beim bisherigen Bestwert.
  • RoboDojo: 20,07 Durchschnittspunkte gegenüber bisher 13,07.
  • VLABench: 59,1 Prozent. RoboCasa: 74,5 Prozent.
  • Wenig-Daten-Anpassung: Beim Feintuning auf vier neue Aufgaben mit weniger als zehn Stunden Daten je Aufgabe erreichte das Modell 75 Prozent — gegenüber 40 Prozent für π0.5.

Der letzte Punkt ist der praktisch wichtigste. Ein Modell, das eine neue Aufgabe aus zehn Stunden Demonstration lernt, verändert die Ökonomie der Robotik: Nicht mehr Monate Datensammlung pro Anwendung, sondern ein Nachmittag.

Mehr Daten schlagen größere ModelleMore data beats bigger models

Die Skalierungskurve aus dem Paper ist die interessanteste Grafik der Arbeit. Ohne Action-Vortraining erreicht das post-trainierte 5B-Modell in unbekannten Umgebungen 26 Prozent Erfolg; mit dem vollen Vortrainingsdatensatz sind es 75 Prozent. Der Sprung durch Daten ist deutlich größer als der Sprung durch Modellgröße — von 2B auf 10B Parameter steigt die Quote nur von 61 auf 79 Prozent.

Wie viel Vortraining bringtHow much pretraining buys

Erfolgsquote des 5B-Modells nach Umfang des Vortrainings
X-Achse ist Datenmenge, keine Zeit · vier Haushaltsaufgaben in unbekannten Umgebungen · Quelle: Paper Abb. 8 · Werte für 5.000 h interpoliert und für 10.000 h abgeleitet (Schätzungen)
100.000+
Stunden reale Manipulationsdaten im Vortraininghours of real manipulation data in pretraining
57,6 %
Erfolgsquote auf RoboCasa365 (bisheriger Bestwert 46,6 %)success rate on RoboCasa365 (previous best 46.6 %)
2,4 Mio.
aufgezeichnete Episoden aus rund 1.700 Umgebungenrecorded episodes from roughly 1,700 environments

Warum Open Source hier zähltWhy open source matters here

Robotik-Grundmodelle waren bisher überwiegend geschlossen. Wer keinen Zugang zu einer Roboterflotte und einem Datenerhebungsteam hat, konnte nicht mitforschen. Code und Checkpoints öffentlich zu machen, verschiebt die Einstiegshürde von „eigene Flotte“ auf „genug GPU-Zeit für ein Feintuning“.

Der eigentliche Beitrag ist nicht die Architektur, sondern die Erkenntnis, dass sich brauchbare Roboterdaten mit einem Greifer in der Hand erheben lassen.

Zurückhaltung bleibt angebracht: Benchmarks in Simulationsumgebungen sind kein Betrieb. Die Zahlen stammen vom Hersteller selbst, unabhängige Replikationen fehlen noch, und die Vergleichswerte anderer Modelle wurden nicht unter identischen Bedingungen erhoben. Weil Code und Gewichte offenliegen, lässt sich das aber diesmal überprüfen — was schon der halbe Fortschritt ist.

QuellenSources

  1. arXiv — Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories: arxiv.org
  2. TechNode — Xiaomi open-sources embodied-AI foundation model Xiaomi-Robotics-1 (5.8.2026): technode.com
  3. The Decoder — Xiaomi-Robotics-1 shows that more data beats bigger models when training robots to move: the-decoder.com
  4. GitHub — XiaomiRobotics/Xiaomi-Robotics-1 (Quellcode): github.com
  5. Hugging Face — XiaomiRobotics/Xiaomi-Robotics-1-5B (Modellgewichte): huggingface.co