Platz 13 im Vergleich
Qwen3.8-Flash-Next
Alibaba (Qwen) · China · veröffentlicht 26. August 2026
Dieses Modell rechnet je Token nur 6 von 125 Milliarden Parametern mit. In 4-Bit-Komprimierung belegen die Gewichte rund 111 GB und laufen damit auf einer einzelnen 96-GB-Karte, die den Rest in den Arbeitsspeicher auslagert. Alibaba nennt es einen Vorgriff auf die Architektur von Qwen4. Die Lizenz erlaubt den internen Einsatz, für einen daraus gebauten KI-Dienst braucht es eine Vereinbarung mit Alibaba.
Zur offiziellen ModellseiteBewertung im Detail
Gesamtnote aus 3 gewichteten Dimensionen. Wie wir bewerten
Fähigkeitsprofil
Wo Qwen3.8-Flash-Next stark ist, über 6 Säulen auf einer Skala von 0 bis 100. Die gestrichelte Linie ist der Median aller 25 Modelle im Vergleich. Wie die Säulen entstehen
| Säule | Wert | Grundlage |
|---|---|---|
| Programmierung | 92 | benchmarkbelegt |
| Mathematik & Logik | 88 | benchmarkbelegt |
| Wissen | 92 | benchmarkbelegt |
| Deutsch & Sprache | 85 | redaktionelle Einschätzung |
| Agentik & Werkzeuge | 91 | benchmarkbelegt |
| Langer Kontext | 86 | redaktionelle Einschätzung |
Stärkste Säule: Programmierung. Belegte Werte stammen aus den dokumentierten Benchmarks unten (baseline-korrigiert normalisiert), mit "Einschätzung" markierte Säulen sind eine redaktionelle Einordnung, weil kein vergleichbarer Benchmark vorlag. Details zur Methodik stehen auf der Übersichtsseite.
Steckbrief
- Architektur
- Mixture-of-Experts
- Parameter
- 125 Mrd. gesamt, 6 Mrd. aktiv je Token
- Kontextfenster
- 256K TokenPer YaRN auf rund 1 Mio. Token erweiterbar, das muss der Betreiber aber selbst einstellen. Von Haus aus nimmt nur die gehostete Fassung die Million entgegen.
- Lizenz
- Qwen Community License 1.0Nutzung im eigenen Unternehmen ist frei, solange weder das Modell noch seine Ausgaben an Dritte gehen. Wer damit Modelle oder einen KI-Assistenten als Dienst anbietet, braucht eine gesonderte Vereinbarung mit Alibaba, und zwar ohne Umsatzschwelle. Ab 100 Mio. monatlichen Nutzern oder 20 Mio. US-Dollar Monatsumsatz muss der Modellname auf der Oberfläche stehen.
- Eingabe
- Text, Bild, Video
- Lokaler Betrieb
- Workstation mit 96-GB-Karte und Auslagerung, unkomprimiert 4 bis 8 GPUs
- Bei EU-Hostern
- SeltenKein EU-Hoster bestätigt. Die Gewichte liegen seit dem 26.08.2026 auf Hugging Face und ModelScope, die QwenCloud-API läuft über Server in China
- Cloud-API (Richtwert)
- 0,14 € Eingabe / 0,40 € Ausgabe je Mio. TokenQwenCloud, Richtwert für die gehostete Fassung Qwen3.8-Flash, umgerechnet aus USD
Aus der offiziellen Modellkarte belegt: 125 Mrd. im Kern mit 512 Experten, davon 6 Mrd. je Token aktiv, dazu eine N-Gramm-Tabelle mit 51 Mrd. und ein Vorhersagemodul mit 4 Mrd. Die Gewichte belegen damit 172,78 GiB in FP8 und 335,28 GiB in BF16.
Benchmarks
Zu diesem Modell liegt neben den Hersteller-Angaben eine unabhängige Einordnung vor (Artificial Analysis).
Wofür es taugt
- Aktiviert je Token nur 6 von 125 Mrd. Parametern, das gleich starke GLM-5.3-Flash rechnet mit 18 von 320 Mrd.
- In 4-Bit-Komprimierung rund 111 GB, das passt auf eine einzelne 96-GB-Karte mit Auslagerung in den Arbeitsspeicher
- 62,5 bei SWE-bench Pro, 91,9 bei LiveCodeBench v6 und 91,7 bei GPQA Diamond
- Bei Büroabläufen 73,9 bei CoWorkBench, gegenüber 48,8 bei GLM-5.3-Flash
- Versteht Bilder und Videos, 88,5 bei RealWorldQA und 76,6 bei LVBench
Wo es hakt
- Die Qwen Community License verlangt für Modell- und Assistenzdienste eine gesonderte Vereinbarung, ohne jede Umsatzschwelle. Das Apache 2.0 von Qwen3.8-27B gilt hier nicht
- Die offenen Gewichte nehmen 262.144 Token entgegen, die Million erreicht nur, wer YaRN selbst konfiguriert
- Die gehostete Fassung heißt Qwen3.8-Flash und ist nicht dasselbe Modell, sie bringt zusätzlich Websuche, Code-Ausführung und Funktionsaufrufe mit
- Kein EU-Hoster bestätigt, ohne eigene Hardware führt der Weg über Alibabas Cloud in China
Quelle: Offizielle HF-Modellkarte Qwen/Qwen3.8-Flash-Next samt LICENSE-Datei, das vLLM-Rezept zur Hardware, Artificial Analysis sowie Berichte von MarkTechPost und DataCamp, August 2026 · Stand der Recherche 16. September 2026 · die Bewertung ist eine redaktionelle Einschätzung von neuost