Zum Inhalt springen
Alle Modelle im Vergleich

Platz 13 im Vergleich

Qwen3.8-Flash-Next

Alibaba (Qwen) · China · veröffentlicht 26. August 2026

88 % Gesamtbewertung

Dieses Modell rechnet je Token nur 6 von 125 Milliarden Parametern mit. In 4-Bit-Komprimierung belegen die Gewichte rund 111 GB und laufen damit auf einer einzelnen 96-GB-Karte, die den Rest in den Arbeitsspeicher auslagert. Alibaba nennt es einen Vorgriff auf die Architektur von Qwen4. Die Lizenz erlaubt den internen Einsatz, für einen daraus gebauten KI-Dienst braucht es eine Vereinbarung mit Alibaba.

Zur offiziellen Modellseite

Bewertung im Detail

Gesamtnote aus 3 gewichteten Dimensionen. Wie wir bewerten

Leistung (55 %) 93 %
DSGVO- und EU-Eignung (30 %) 84 %
Lizenz-Offenheit (15 %) 80 %

Fähigkeitsprofil

Wo Qwen3.8-Flash-Next stark ist, über 6 Säulen auf einer Skala von 0 bis 100. Die gestrichelte Linie ist der Median aller 25 Modelle im Vergleich. Wie die Säulen entstehen

Coding 92 Mathe & Logik 88 Wissen 92 Deutsch 85* Agentik 91 Kontext 86*
Qwen3.8-Flash-Next Median aller Modelle * redaktionelle Einschätzung (kein belegter Benchmark)
Fähigkeitsprofil von Qwen3.8-Flash-Next, Werte von 0 bis 100
SäuleWertGrundlage
Programmierung92benchmarkbelegt
Mathematik & Logik88benchmarkbelegt
Wissen92benchmarkbelegt
Deutsch & Sprache85redaktionelle Einschätzung
Agentik & Werkzeuge91benchmarkbelegt
Langer Kontext86redaktionelle Einschätzung
Programmierung 92
Code schreiben und debuggen, ganze Repositories über viele Schritte bearbeiten
Wissen 92
Fach- und Allgemeinwissen über viele Domänen hinweg
Agentik & Werkzeuge 91
Werkzeuge selbständig aufrufen und mehrstufige Abläufe steuern
Mathematik & Logik 88
mehrstufiges Rechnen und logisches Schließen mit prüfbarer Lösung
Langer Kontext · Einschätzung 86
nutzbare Leistung über sehr lange Eingaben, nicht nur die Fenstergröße
Deutsch & Sprache · Einschätzung 85
Sprachverständnis und Mehrsprachigkeit, mit Blick auf Deutsch

Stärkste Säule: Programmierung. Belegte Werte stammen aus den dokumentierten Benchmarks unten (baseline-korrigiert normalisiert), mit "Einschätzung" markierte Säulen sind eine redaktionelle Einordnung, weil kein vergleichbarer Benchmark vorlag. Details zur Methodik stehen auf der Übersichtsseite.

Steckbrief

Architektur
Mixture-of-Experts
Parameter
125 Mrd. gesamt, 6 Mrd. aktiv je Token
Kontextfenster
256K TokenPer YaRN auf rund 1 Mio. Token erweiterbar, das muss der Betreiber aber selbst einstellen. Von Haus aus nimmt nur die gehostete Fassung die Million entgegen.
Lizenz
Qwen Community License 1.0Nutzung im eigenen Unternehmen ist frei, solange weder das Modell noch seine Ausgaben an Dritte gehen. Wer damit Modelle oder einen KI-Assistenten als Dienst anbietet, braucht eine gesonderte Vereinbarung mit Alibaba, und zwar ohne Umsatzschwelle. Ab 100 Mio. monatlichen Nutzern oder 20 Mio. US-Dollar Monatsumsatz muss der Modellname auf der Oberfläche stehen.
Eingabe
Text, Bild, Video
Lokaler Betrieb
Workstation mit 96-GB-Karte und Auslagerung, unkomprimiert 4 bis 8 GPUs
Bei EU-Hostern
SeltenKein EU-Hoster bestätigt. Die Gewichte liegen seit dem 26.08.2026 auf Hugging Face und ModelScope, die QwenCloud-API läuft über Server in China
Cloud-API (Richtwert)
0,14 € Eingabe / 0,40 € Ausgabe je Mio. TokenQwenCloud, Richtwert für die gehostete Fassung Qwen3.8-Flash, umgerechnet aus USD

Aus der offiziellen Modellkarte belegt: 125 Mrd. im Kern mit 512 Experten, davon 6 Mrd. je Token aktiv, dazu eine N-Gramm-Tabelle mit 51 Mrd. und ein Vorhersagemodul mit 4 Mrd. Die Gewichte belegen damit 172,78 GiB in FP8 und 335,28 GiB in BF16.

Benchmarks

Zu diesem Modell liegt neben den Hersteller-Angaben eine unabhängige Einordnung vor (Artificial Analysis).

62,5 SWE-bench Pro
91,7 GPQA Diamond
91,9 LiveCodeBench v6
56 Artificial Analysis Index (unabhängig)

Wofür es taugt

  • Aktiviert je Token nur 6 von 125 Mrd. Parametern, das gleich starke GLM-5.3-Flash rechnet mit 18 von 320 Mrd.
  • In 4-Bit-Komprimierung rund 111 GB, das passt auf eine einzelne 96-GB-Karte mit Auslagerung in den Arbeitsspeicher
  • 62,5 bei SWE-bench Pro, 91,9 bei LiveCodeBench v6 und 91,7 bei GPQA Diamond
  • Bei Büroabläufen 73,9 bei CoWorkBench, gegenüber 48,8 bei GLM-5.3-Flash
  • Versteht Bilder und Videos, 88,5 bei RealWorldQA und 76,6 bei LVBench

Wo es hakt

  • Die Qwen Community License verlangt für Modell- und Assistenzdienste eine gesonderte Vereinbarung, ohne jede Umsatzschwelle. Das Apache 2.0 von Qwen3.8-27B gilt hier nicht
  • Die offenen Gewichte nehmen 262.144 Token entgegen, die Million erreicht nur, wer YaRN selbst konfiguriert
  • Die gehostete Fassung heißt Qwen3.8-Flash und ist nicht dasselbe Modell, sie bringt zusätzlich Websuche, Code-Ausführung und Funktionsaufrufe mit
  • Kein EU-Hoster bestätigt, ohne eigene Hardware führt der Weg über Alibabas Cloud in China

Quelle: Offizielle HF-Modellkarte Qwen/Qwen3.8-Flash-Next samt LICENSE-Datei, das vLLM-Rezept zur Hardware, Artificial Analysis sowie Berichte von MarkTechPost und DataCamp, August 2026 · Stand der Recherche 16. September 2026 · die Bewertung ist eine redaktionelle Einschätzung von neuost