Zum Inhalt springen
Alle Modelle im Vergleich

Platz 5 im Vergleich

GLM-5.3-Flash

Zhipu AI (Z.ai) · China · veröffentlicht 26. August 2026

92 % Gesamtbewertung

Das erste Modell der GLM-Reihe, das Bilder und Videos versteht. Z.ai hat die Gewichte am 26. August 2026 unter MIT freigegeben. Artificial Analysis misst 57 Punkte im Intelligenz-Index, einen mehr als das am selben Tag erschienene Qwen3.8-Flash-Next. Über die API kostet es rund ein Zehntel von GLM-5.3, im Eigenbetrieb braucht es einen Server mit 8 Grafikkarten.

Zur offiziellen Modellseite

Bewertung im Detail

Gesamtnote aus 3 gewichteten Dimensionen. Wie wir bewerten

Leistung (55 %) 95 %
DSGVO- und EU-Eignung (30 %) 84 %
Lizenz-Offenheit (15 %) 100 %

Fähigkeitsprofil

Wo GLM-5.3-Flash stark ist, über 6 Säulen auf einer Skala von 0 bis 100. Die gestrichelte Linie ist der Median aller 25 Modelle im Vergleich. Wie die Säulen entstehen

Coding 92 Mathe & Logik 86* Wissen 88* Deutsch 82* Agentik 93 Kontext 90*
GLM-5.3-Flash Median aller Modelle * redaktionelle Einschätzung (kein belegter Benchmark)
Fähigkeitsprofil von GLM-5.3-Flash, Werte von 0 bis 100
SäuleWertGrundlage
Programmierung92benchmarkbelegt
Mathematik & Logik86redaktionelle Einschätzung
Wissen88redaktionelle Einschätzung
Deutsch & Sprache82redaktionelle Einschätzung
Agentik & Werkzeuge93benchmarkbelegt
Langer Kontext90redaktionelle Einschätzung
Agentik & Werkzeuge 93
Werkzeuge selbständig aufrufen und mehrstufige Abläufe steuern
Programmierung 92
Code schreiben und debuggen, ganze Repositories über viele Schritte bearbeiten
Langer Kontext · Einschätzung 90
nutzbare Leistung über sehr lange Eingaben, nicht nur die Fenstergröße
Wissen · Einschätzung 88
Fach- und Allgemeinwissen über viele Domänen hinweg
Mathematik & Logik · Einschätzung 86
mehrstufiges Rechnen und logisches Schließen mit prüfbarer Lösung
Deutsch & Sprache · Einschätzung 82
Sprachverständnis und Mehrsprachigkeit, mit Blick auf Deutsch

Stärkste Säule: Agentik & Werkzeuge. Belegte Werte stammen aus den dokumentierten Benchmarks unten (baseline-korrigiert normalisiert), mit "Einschätzung" markierte Säulen sind eine redaktionelle Einordnung, weil kein vergleichbarer Benchmark vorlag. Details zur Methodik stehen auf der Übersichtsseite.

Steckbrief

Architektur
Mixture-of-Experts
Parameter
320 Mrd. gesamt, 18 Mrd. aktiv je Token
Kontextfenster
1 Mio. TokenEin Teil der Schichten verarbeitet lange Eingaben nach einem sparsameren Verfahren als üblich. Z.ai gibt dafür rund ein Drittel der Rechenlast und ein Viertel des Zwischenspeichers gegenüber GLM-5.3 an.
Lizenz
MIT
Eingabe
Text, Bild, Video
Lokaler Betrieb
Server mit 8 GPUs (H100/H200) oder ein GB200-Einschub
Bei EU-Hostern
SeltenKein EU-Hoster bestätigt. Die Gewichte liegen seit dem 26.08.2026 auf Hugging Face, der DSGVO-konforme Betrieb läuft über eigene Hardware
Cloud-API (Richtwert)
0,13 € Eingabe / 0,43 € Ausgabe je Mio. TokenZ.ai-API, Richtwert (uncached input), umgerechnet aus USD

Aus der offiziellen Modellkarte belegt, ebenso die Architektur mit 8 von 288 Experten je Token und 45 Schichten. Die Gewichte liegen nativ in FP8 vor und belegen rund 306 GiB.

Benchmarks

Zu diesem Modell liegt neben den Hersteller-Angaben eine unabhängige Einordnung vor (Artificial Analysis).

84,3 Terminal-Bench 2.1
63,4 DeepSWE v1.1
78,4 Toolathlon Verified
57 Artificial Analysis Index (unabhängig)

Wofür es taugt

  • Versteht als erstes GLM-Modell Bilder und Videos, mit 77,8 bei MVBench und 80,5 bei MMVU
  • Artificial Analysis misst 57 Punkte im Intelligenz-Index, gleichauf mit Kimi K3 und über GLM-5.2 mit 53
  • MIT-Lizenz ohne Auflage, anders als beim größeren GLM-5.3 mit seiner eigenen Lizenz
  • 84,3 bei Terminal-Bench 2.1, wo Z.ai für Claude Opus 4.8 85,0 angibt
  • In der Z.ai-API 0,13 Euro je Mio. Token Eingabe, gegenüber 1,21 Euro bei GLM-5.3

Wo es hakt

  • Kein EU-Hoster führt das Modell, ohne eigene Hardware führt der Weg über die Z.ai-API in China
  • Die 306 GiB Gewichte verlangen einen Server mit 8 Grafikkarten, eine einzelne Workstation reicht nicht
  • Mathematik-Benchmarks hat Z.ai nicht gemeldet, für diese Säule steht eine redaktionelle Einschätzung
  • Beim Programmieren über viele Schritte liegt das größere GLM-5.3 vorn, 88,2 gegenüber 84,3 bei Terminal-Bench 2.1

Quelle: Offizielle HF-Modellkarte zai-org/GLM-5.3-Flash, Z.ai-Ankündigung vom 26.08.2026, Artificial Analysis sowie Berichte von MarkTechPost und DataCamp · Stand der Recherche 16. September 2026 · die Bewertung ist eine redaktionelle Einschätzung von neuost