Zum Inhalt springenSkip to content
msm FortschrittsberichtProgress report
msm/RobotikRobotics/LingBot-VLA 2.0
Robotik · China · Juli 2026

Ein Modell, zwanzig Körper: LingBot-VLA 2.0 wird Open Source.

This article is currently available in German only — an English version will follow. Der Text liegt bisher nur auf Deutsch vor.

Zusammenfassung

Am 8. Juli 2026 hat Robbyant, die Robotik-Einheit der Ant Group, das Modell LingBot-VLA 2.0 unter Apache-2.0-Lizenz veröffentlicht — inklusive Gewichten, Code und technischem Bericht. Das 6-Milliarden-Parameter-Modell übersetzt Kamerabilder und eine sprachliche Anweisung in Roboterbewegungen und beherrscht dabei 20 verschiedene Roboterkonfigurationen in einem einzigen, 55-dimensionalen Aktionsraum: vom Einarmgreifer bis zum kompletten Humanoiden. Trainiert wurde es auf rund 60.000 Stunden Bewegungsdaten. Damit steht die Steuerungsschicht, an der Konzerne jahrelang exklusiv gearbeitet haben, erstmals in dieser Qualität frei zur Verfügung.

Was ist ein VLA-Modell?

Vision-Language-Action-Modelle sind der Versuch, Robotern das Gleiche zu geben, was Sprachmodelle Computern gegeben haben: eine allgemeine Fähigkeit statt einer programmierten Einzelfunktion. Das Modell bekommt Kamerabilder und einen Satz — „räum die Getränke in den Kühlschrank" — und erzeugt daraus direkt die Gelenkwinkel und Greiferbefehle. Was früher wochenlanges Einprogrammieren jeder einzelnen Bewegung bedeutete, wird zu einer Anweisung in natürlicher Sprache.

Das bekannte Problem dieser Modelle: Sie funktionieren im Labor und scheitern im Einsatz. Genau an dieser Lücke setzt Version 2.0 an, und zwar an drei Stellen — Generalisierung, erweiterter Aktionsraum und vorausschauende Dynamikmodellierung.

Der Kern: ein gemeinsamer Aktionsraum

Roboter unterscheiden sich in ihren Gelenken, deshalb brauchte bislang praktisch jeder Bautyp sein eigenes Modell. LingBot-VLA 2.0 vereinheitlicht das über einen festen 55-dimensionalen Vektor für Zustände und Aktionen: 14 Dimensionen für Armgelenke, 14 für Endeffektor-Posen, 2 für Greifer, 12 für Handgelenke, 4 für die Hüfte, 2 für den Kopf, 3 für die Fortbewegung, dazu vier reservierte. Fehlt einem Roboter ein Körperteil, werden die entsprechenden Dimensionen einfach mit Nullen aufgefüllt.

Das klingt technisch, ist aber die eigentliche Nachricht: Ein einziges Modell steuert Arme, Hände, Greifer, Hüften, Köpfe und mobile Basen. Erfahrung, die auf einem Einarmroboter gesammelt wurde, kommt dem Humanoiden zugute. Bislang war jede Roboterfamilie eine eigene Dateninsel.

Wie das Modell abschneidet

GM-100 Benchmark — Fortschrittswert auf AgileX Cobot Magic
generalistische Einstellung, eine Policy für neun Aufgaben · Quelle: Robbyant, technischer Bericht
60.000
Stunden Trainingsdaten (50.000 Roboter, 10.000 Egoperspektive)
130 ms
Inferenzzeit pro Aufruf auf einer RTX 4090D
Apache 2.0
Lizenz für Code und 6B-Modellgewichte

Warum das eine positive Entwicklung ist

  • Offene Gewichte in Spitzenqualität. Das Modell schlägt auf dem GM-100-Benchmark sowohl π0.5 als auch die eigene Vorversion — und liegt frei verfügbar auf Hugging Face. Forschungsgruppen und mittelständische Integratoren arbeiten damit auf demselben Stand wie große Labore.
  • Bezahlbare Hardware genügt. 130 Millisekunden Inferenz auf einer einzelnen Consumer-Grafikkarte bedeutet: Für den Einstieg braucht es kein Rechenzentrum.
  • Sorgfältige Datenarbeit statt roher Menge. Aus rund 90.000 Roboter- und 20.000 Egoperspektiv-Stunden wurde auf 60.000 Stunden gefiltert — über Ruckmaße, Geschwindigkeits-Z-Werte und URDF-Abgleich. Episoden mit über 95 Prozent statischem Signal flogen raus. Dass diese Kriterien offengelegt sind, ist für die ganze Disziplin wertvoller als das Modell selbst.
  • Vorausschau statt Reaktion. Zwei lernbare Abfragen richten sich auf die aktuelle und eine künftige Beobachtung; Lehrer-Modelle liefern Tiefengeometrie und zeitliche Semantik. Der Roboter reagiert damit nicht nur auf das aktuelle Bild, sondern antizipiert den nächsten Schritt.

Was das praktisch bedeutet

Die dokumentierten Einsatzszenarien sind bewusst alltäglich: Ein Astribot S1 sortiert Obst und Getränke in einen Kühlschrank — dafür muss er sich bewegen, eine Tür öffnen und Gegenstände ablegen. Ein Cobot Magic-ARX X5 wischt Schaum von einem Herd, was Greifen, Wischen und Umsetzen des Werkzeugs verkettet. In beiden Fällen liegt das Modell auch dann vor π0.5, wenn Objekte und Posen gegenüber dem Training verändert werden — dem sogenannten Out-of-Distribution-Fall, an dem Robotersteuerungen üblicherweise scheitern.

Bemerkenswert ist auch die Unterstützung geschickter Hände: Unitree G1, Fourier GR-2 und AgiBot A2 arbeiten mit zwölf Freiheitsgraden pro Hand statt mit einfachen Greifern. Bei einer Aufgabe — dem Aufnehmen eines Schlüsselbunds — stieg die Erfolgsrate gegenüber Version 1.0 von 60 auf 100 Prozent.

„Die spannendste Zahl ist nicht die Modellgröße, sondern die Lizenz."

Was bleibt offen?

Die Benchmark-Werte zeigen ein wiederkehrendes Muster: Der Fortschrittswert liegt deutlich über der Erfolgsrate — 66,2 gegenüber 34,4 Punkten auf dem AgileX-System. Das heißt, der Roboter kommt weit, scheitert aber häufig am letzten Schritt, dem präzisen Ablegen oder Loslassen. Genau diese Endphase entscheidet in der Praxis über Brauchbarkeit. Zweitens sind die Ergebnisse überwiegend auf Plattformen erhoben, die im Trainingskorpus vertreten sind; wie das Modell auf völlig fremder Hardware abschneidet, ist offen. Und drittens gilt für offene Robotermodelle dieselbe Frage wie für offene Sprachmodelle: Wer prüft, wofür sie eingesetzt werden. Trotzdem — dass die Steuerungsschicht für zwanzig Roboterbauformen unter einer freien Lizenz verfügbar ist, verschiebt die Einstiegshürde für die gesamte Branche nach unten.

Original-Quellen

Mehr lesen direkt bei technology.robbyant.com

Quellen

  1. MarkTechPost — Robbyant Releases LingBot-VLA 2.0: An Open-Source 6B Vision-Language-Action Model (08.07.2026): marktechpost.com
  2. Robbyant — technische Projektseite LingBot-VLA v2: technology.robbyant.com
  3. Hugging Face — Modellgewichte LingBot-VLA v2: huggingface.co
  4. GitHub — technischer Bericht (PDF): github.com
  5. The Robot Report — Vision-language-action models are the next leap in autonomous robotics: therobotreport.com
  6. MarkTechPost — Ant Group's Robbyant Unveils LingBot-VA 2.0 (11.07.2026): marktechpost.com