Zum Inhalt springen

KI-Agenten

Qwen-AgentWorld
im Test.

Qwen-AgentWorld ist eine Modellreihe von Alibaba, die die Umgebung simuliert, in der ein KI-Agent arbeitet, statt Aufgaben selbst zu lösen. Sie deckt 7 Umgebungen ab, von MCP und Terminal über Software-Entwicklung bis Android und Web. Herunterladbar ist davon das kleinere 35B-A3B unter Apache 2.0, die Gewichte des großen 397B-A17B hat Alibaba bis heute zurückgehalten.

4,0 von 5

Stand 4. August 2026

Preismodell Kostenlos, Apache 2.0, Kosten entstehen nur durch eigene Hardware
Betriebsort auf eigener Hardware
DSGVO im Einzelfall zu prüfen
Quelloffen ja, Apache-2.0

Wer KI-Agenten baut, steht vor einem teuren Problem. Ein Agent, der Befehle im Terminal ausführt, eine Webseite bedient oder ein Smartphone steuert, muss zum Training und Testen immer wieder auf echte Systeme zugreifen. Das kostet Zeit, und weil sich der Zustand dieser Systeme dabei verändert, bekommst du denselben Fehler kaum ein zweites Mal zu sehen. Qwen-AgentWorld ersetzt die echte Linux-Shell und den echten Browser durch ein Sprachmodell, das beschreibt, wie sie auf eine Agenten-Aktion reagieren würden.

Ein klassisches Sprachmodell beantwortet Text mit Text. Beim Language World Model übernimmt das Modell dagegen die Rolle der Welt, in der ein Agent handelt. Der Agent sagt etwa “ich öffne das Terminal und tippe ls”, und das Modell antwortet mit dem, was danach auf dem Bildschirm stünde. So handelt ein Agent Schritt für Schritt, ohne je ein echtes System anzufassen.

Wichtigste Funktionen

  • Sieben simulierte Umgebungen: In einem einzigen Modell stecken Suche, Terminal, Software-Entwicklung, Android, Web, Desktop-Betriebssystem und MCP, der offene Standard, über den Agenten externe Werkzeuge ansprechen. Damit reicht die Bandbreite von der Kommandozeile bis zur grafischen Oberfläche auf Smartphone und Rechner.
  • Umgebung als Trainingsziel: Frühere Modelle lernten zuerst den Dialog und erst danach die Agenten-Aufgaben. Bei Qwen-AgentWorld war die Nachbildung der Umgebung schon ab der ersten Trainingsstufe das Ziel, nach Angaben von Alibaba auf mehr als 10 Mio. echten Interaktionsverläufen. Das macht die Reaktionen der Simulation verlässlicher als bei umfunktionierten Chat-Modellen.
  • Zwei Modellgrößen, eine davon offen: Herunterladbar ist das 35B-A3B, ein Mixture-of-Experts mit 35 Mrd. Parametern, von denen je Anfrage 3 Mrd. rechnen, bei 256K Kontext. Das größere 397B-A17B steht in allen Tabellen des Herstellers, seine Gewichte hat Alibaba seit dem Start im Juni 2026 nicht herausgegeben.
  • Gesteuerte Störungen und erfundene Welten: Über Steueranweisungen baust du gezielt Störungen in die Simulation ein, um Schwächen eines Agenten sichtbar zu machen. Alibaba misst in MCPMark 33,8 Punkte für einen Agenten, der in der gesteuerten Simulation nachtrainiert wurde, gegenüber 24,6 in der ungesteuerten. Auch vollständig erfundene, in sich stimmige Suchwelten funktionieren, das Gelernte überträgt sich im WideSearch-Test von 34,02 auf 50,31 Punkte.
  • AgentWorldBench: Alibaba hat einen Benchmark mit 2.170 Aufgaben über dieselben 7 Umgebungen mitveröffentlicht, der jede vorhergesagte Reaktion nach Format, Faktentreue, Widerspruchsfreiheit, Realismus und Qualität bewertet. Das herunterladbare 35B-A3B erreicht 56,39 Punkte, das zurückgehaltene 397B-A17B 58,71 und liegt damit vor GPT-5.4 (58,25).
  • Offene Schnittstellen und fertige Vorlagen: Das Modell läuft über vLLM, SGLang und Transformers. Auf Hugging Face und ModelScope liegen die Gewichte zum Herunterladen bereit, im Repository dazu eine Systemprompt-Vorlage für jede der 7 Umgebungen und die Bewertungsprompts des Benchmarks.

Preise und Tarife

Das 35B-A3B und der AgentWorldBench stehen unter Apache 2.0 kostenlos zur Verfügung, ohne Einschränkung für die kommerzielle Nutzung. Kosten entstehen allein durch die Hardware. Die offizielle Startanleitung verteilt das Modell über 4 Grafikkarten und setzt die Kontextlänge auf rund 262.000 Token, das läuft auf einen Server mit mehreren Karten hinaus.

Verkleinerte (quantisierte) Fassungen von Dritten liegen auf Hugging Face, sie senken den Speicherbedarf und kosten dafür Genauigkeit. Was dein Hardware- oder Rechenzentrumsanbieter für Grafikkarten und Strom berechnet, sind Nettopreise, auf die die Umsatzsteuer noch aufschlägt.

Für wen ist Qwen-AgentWorld geeignet?

  • Teams, die eigene KI-Agenten entwickeln: Ein Agent für Terminal, Browser oder Smartphone durchläuft Training und Test in der Simulation, bevor er das erste Mal auf ein echtes System zugreift. Das spart Zeit und vermeidet Schäden durch fehlerhafte Aktionen während der Entwicklung.
  • KI-Forschung und Hochschulen: Das offene Modell samt Benchmark ist eine Grundlage, um Agenten-Verhalten reproduzierbar zu untersuchen und neue Ansätze gegen einen einheitlichen Maßstab zu messen.
  • Anbieter von Agenten-Plattformen: Einen Agenten-Baukasten oder ein Automatisierungsprodukt prüfst du in der Simulation daraufhin, wie Planung, Werkzeug-Nutzung und Umgebung ineinandergreifen, ohne für jeden Testlauf reale Infrastruktur bereitzustellen.

DSGVO und Datenschutz

Die Gewichte des 35B-A3B stehen unter Apache 2.0, und die Dokumentation kennt für den Betrieb nur die eigene Maschine mit einem lokalen Endpunkt. Eine gehostete Fassung des Modells gibt es bei Alibaba nicht, weder über Model Studio noch über DashScope, und auch bei Vermittlern wie OpenRouter ist es nicht gelistet, geprüft am 04.08.2026. Ohne Anbieter dazwischen wertet auch niemand deine Eingaben für weiteres Training aus.

Die Ampel steht hier trotzdem auf Nein. Alibaba sitzt in Hangzhou, und für China hat die EU-Kommission kein mit der DSGVO vergleichbares Schutzniveau festgestellt. Einen Auftragsverarbeitungsvertrag für dieses Modell gibt es nicht, denn das öffentlich abrufbare EEA-Addendum von Alibaba Cloud gilt für die Cloud-Dienste des Anbieters und nicht für einen Modell-Download.

Vom stärksten Modell der Reihe, dem 397B-A17B, hat Alibaba die Gewichte zurückgehalten. Wer damit arbeiten will, bleibt auf den Hersteller angewiesen. Dazu kommt das mitgelieferte Auswertungsskript, das im dokumentierten Standardfall die OpenAI-API in den USA aufruft, um die Antworten des Modells zu bewerten.

Das 35B-A3B rechnet komplett auf deinen eigenen Grafikkarten, und für die Bewertung tauschst du über den Parameter --judge-base-url ein lokales Modell oder einen europäischen Anbieter ein. In einer simulierten Umgebung genügen Testdaten, echte Kundendaten braucht es dafür nicht. Sobald doch personenbezogene Daten in eine Simulation geraten, gilt dieselbe Prüfung wie bei jedem anderen offenen Modell auf eigener Hardware, also dokumentierter Zweck und keine Weitergabe an Dritte. Für die Entwicklungs- und Testarbeit, für die Alibaba das Modell gebaut hat, halten wir den Selbstbetrieb für unbedenklich.

Alternativen zu Qwen-AgentWorld

  • Qwen3.8-27B: das agentische Modell derselben Familie, das auf einer einzelnen 24-GB-Grafikkarte läuft. Es löst Aufgaben selbst und ist damit genau der Agent, den du in einer Simulation wie Qwen-AgentWorld testest.
  • AgentScope: ebenfalls von Alibaba, ein Baukasten für Aufbau und Betrieb von Multi-Agenten-Systemen. Es liefert das Gerüst für Agenten, aber keine simulierte Umgebung zum Training.
  • Deep Agents: Bausatz für langlaufende Agenten mit Planung und Gedächtnis. Er zielt auf den direkten Einsatz in der Praxis und verzichtet auf den Forschungs- und Simulationsteil von Qwen-AgentWorld.

Wofür Qwen-AgentWorld taugt

  • Das offene 35B-A3B erreicht im AgentWorldBench 56,39 Punkte und liegt damit vor Gemini 3.1 Pro (54,57) und DeepSeek-V4-Pro (52,97)
  • Modellgewichte und Benchmark unter Apache 2.0, uneingeschränkte kommerzielle Nutzung
  • Simuliert 7 Umgebungen in einem Modell, von MCP und Terminal über Software-Entwicklung bis Android und Web
  • 256K Kontext und fertige Systemprompt-Vorlagen für jede der 7 Umgebungen im Repository

Wo es hakt

  • Die Gewichte des großen 397B-A17B mit den Bestwerten hat Alibaba nicht herausgegeben
  • Werkzeug für Agenten-Entwicklung und Forschung, kein fertiger Assistent für den Büroalltag
  • Die offizielle Startanleitung verteilt schon das kleine Modell auf 4 Grafikkarten
  • Das mitgelieferte Auswertungsskript ruft im Standardfall die OpenAI-API in den USA auf

Wofür es eingesetzt wird

KI-Agenten trainieren · Agenten-Verhalten testen ohne echte Systeme · Agenten-Baukästen bewerten · Werkzeug-Nutzung von Agenten simulieren