Zum Inhalt springen
Alle Modelle im Vergleich

Platz 4 im Vergleich

GLM-5.3

Zhipu AI (Z.ai) · China · veröffentlicht 14. August 2026

92 % Gesamtbewertung

Z.ai hat für GLM-5.3 dasselbe Basismodell wie für GLM-5.2 genommen und nur das Nachtraining erneuert. Beim Programmieren über viele Schritte meldet der Hersteller daraus 28,3 bei Terminal-Bench 3.0 gegenüber 4,6 für den Vorgänger. Die Gewichte sind seit dem 28. August 2026 offen, allerdings nicht mehr unter MIT. Ab 10 Mrd. US-Dollar Umsatz verlangt Z.ai vorher eine eigene Sicherheitsprüfung, für alle darunter ändert sich nichts.

Zur offiziellen Modellseite

Bewertung im Detail

Gesamtnote aus 3 gewichteten Dimensionen. Wie wir bewerten

Leistung (55 %) 96 %
DSGVO- und EU-Eignung (30 %) 84 %
Lizenz-Offenheit (15 %) 95 %

Fähigkeitsprofil

Wo GLM-5.3 stark ist, über 6 Säulen auf einer Skala von 0 bis 100. Die gestrichelte Linie ist der Median aller 25 Modelle im Vergleich. Wie die Säulen entstehen

Coding 94* Mathe & Logik 90* Wissen 90* Deutsch 82* Agentik 93* Kontext 88*
GLM-5.3 Median aller Modelle * redaktionelle Einschätzung (kein belegter Benchmark)
Fähigkeitsprofil von GLM-5.3, Werte von 0 bis 100
SäuleWertGrundlage
Programmierung94redaktionelle Einschätzung
Mathematik & Logik90redaktionelle Einschätzung
Wissen90redaktionelle Einschätzung
Deutsch & Sprache82redaktionelle Einschätzung
Agentik & Werkzeuge93redaktionelle Einschätzung
Langer Kontext88redaktionelle Einschätzung
Programmierung · Einschätzung 94
Code schreiben und debuggen, ganze Repositories über viele Schritte bearbeiten
Agentik & Werkzeuge · Einschätzung 93
Werkzeuge selbständig aufrufen und mehrstufige Abläufe steuern
Mathematik & Logik · Einschätzung 90
mehrstufiges Rechnen und logisches Schließen mit prüfbarer Lösung
Wissen · Einschätzung 90
Fach- und Allgemeinwissen über viele Domänen hinweg
Langer Kontext · Einschätzung 88
nutzbare Leistung über sehr lange Eingaben, nicht nur die Fenstergröße
Deutsch & Sprache · Einschätzung 82
Sprachverständnis und Mehrsprachigkeit, mit Blick auf Deutsch

Stärkste Säule: Programmierung. Belegte Werte stammen aus den dokumentierten Benchmarks unten (baseline-korrigiert normalisiert), mit "Einschätzung" markierte Säulen sind eine redaktionelle Einordnung, weil kein vergleichbarer Benchmark vorlag. Details zur Methodik stehen auf der Übersichtsseite.

Steckbrief

Architektur
Mixture-of-Experts
Parameter
744 Mrd. gesamt, 40 Mrd. aktiv je Token
Kontextfenster
1 Mio. TokenDie Million Token ist über die Variante glm-5.3[1m] dokumentiert, wie schon beim Vorgänger.
Lizenz
GLM-5.3 LicenseEigene Lizenz von Z.ai, nicht die MIT der Vorgänger GLM-5.1 und GLM-5.2. Für alle übrigen Nutzer gelten dieselben Rechte wie unter MIT. Ein Unternehmen mit mehr als 10 Mrd. US-Dollar Umsatz in 12 Monaten muss vor dem kommerziellen Einsatz eine Sicherheitsprüfung von Z.ai durchlaufen, das Modell und alle daraus abgeleiteten Modelle eingeschlossen.
Eingabe
Text
Lokaler Betrieb
Mehrere RTX PRO 6000 (96 GB), Mac Studio oder H200
Bei EU-Hostern
SeltenKein EU-Hoster bestätigt. Die Gewichte liegen seit dem 28.08.2026 auf Hugging Face, in FP8 unter zai-org/GLM-5.3 und in BF16 daneben, der DSGVO-konforme Betrieb läuft über eigene Hardware
Cloud-API (Richtwert)
1,21 € Eingabe / 3,79 € Ausgabe je Mio. TokenZ.ai-API, Richtwert (uncached input), umgerechnet aus USD

Z.ai nennt für GLM-5.3 dasselbe Basismodell wie für GLM-5.2, neu ist allein das Nachtraining. Die Modellkarte nennt seit der Freigabe 753 Mrd. Parameter für die gesamte veröffentlichte Fassung, für den Mixture-of-Experts-Kern nennen Drittquellen rund 744 Mrd. Der Aktivwert von 40 Mrd. ist aus dem Vorgänger übernommen.

Benchmarks

Die folgenden Werte sind Hersteller-Angaben. Eine unabhängige Verifikation lag zum Stand dieser Seite nicht vor.

88,2 Terminal-Bench 2.1
28,3 Terminal-Bench 3.0
66,9 DeepSWE v1.1
84,5 CyberGym

GLM-5.3 von Z.ai ist am 14. August 2026 erschienen, keine 2 Monate nach GLM-5.2. Das Basismodell mit 743 Milliarden Parametern ist dasselbe geblieben, erneuert hat der Hersteller allein das Nachtraining. Z.ai meldet daraus 28,3 bei Terminal-Bench 3.0 gegenüber 4,6 für GLM-5.2, 66,9 statt 46,2 bei DeepSWE v1.1 und 42,5 statt 19,4 bei SWE-Marathon v1.1. Diese Benchmarks sind neu und härter gebaut als die Fassungen, mit denen die übrigen Modelle in unserem Vergleich gemessen wurden. Wer die 28,3 neben die 81,0 legt, die GLM-5.2 bei Terminal-Bench 2.1 erreicht, vergleicht 2 verschiedene Skalen miteinander.

Bei CyberGym, wo ein Modell Schwachstellen in fremdem Code finden und nachweisen muss, kommt GLM-5.3 auf 84,5 % nach 77,2 % beim Vorgänger. Beim Erzeugen von Angriffscode bleibt es mit 54,4 % bei ExploitBench hinter Claude Fable 5 mit 78,0 % zurück, was Z.ai als gewollte Ausrichtung auf die Verteidigung beschreibt. Damit führt GLM-5.3 nicht das ganze Feld an. Nach der Auswertung von explainx liegen GPT-5.6 Sol von OpenAI und Fable 5 bei mehreren dieser Benchmarks vorn, der Vorsprung von GLM-5.3 beschränkt sich auf Automatisierung und defensive Sicherheit.

Für den Eigenbetrieb gilt dieselbe Hürde wie bei GLM-5.2, also mehrere Workstation-Karten, ein Mac Studio mit sehr viel Unified Memory oder ein Server mit 8 H200. Anders als der Vorgänger, der bei Scaleway in Frankreich läuft, steht GLM-5.3 bei keinem europäischen Hoster, der datenschutzkonforme Einsatz führt hier also über eigene Hardware. Die Gewichte hat Z.ai für Ende August 2026 angekündigt und ihre Freigabe an eigene Sicherheitsprüfungen geknüpft, die Lizenz dabei offen gelassen. GLM-5.1 und GLM-5.2 stehen unter MIT, davon geht unsere Bewertung aus. Token-Preise für die API fehlten zum Start, die Sätze des Vorgängers lassen sich nicht übertragen.

Wofür es taugt

  • Z.ai meldet 28,3 bei Terminal-Bench 3.0 gegenüber 4,6 für GLM-5.2 und 66,9 statt 46,2 bei DeepSWE v1.1
  • 84,5 % bei CyberGym, wo ein Modell Schwachstellen in fremdem Code finden und belegen muss, nach 77,2 % beim Vorgänger
  • Nimmt eine Million Token je Anfrage entgegen und läuft auf derselben Hardware wie GLM-5.2
  • Die Gewichte liegen seit dem 28.08.2026 offen auf Hugging Face, in FP8 und in BF16

Wo es hakt

  • Kein EU-Hoster führt das Modell, der datenschutzkonforme Betrieb läuft über eigene Hardware
  • Eigene Lizenz statt der MIT von GLM-5.1 und GLM-5.2, mit Prüfpflicht für Konzerne ab 10 Mrd. US-Dollar Umsatz
  • Nur Text, keine Bild- oder Videoverarbeitung. Dafür gibt es seit dem 26.08.2026 GLM-5.3-Flash
  • Die FP8-Gewichte belegen rund 750 GB, erst eine 2-Bit-Komprimierung mit 239 GB passt auf einen Mac Studio, und die schafft dort 3 bis 9 Token je Sekunde
  • Alle Zahlen kommen vom Hersteller, ein Teil davon aus einer neuen Benchmark-Generation, die sich mit den Werten der übrigen Modelle nicht direkt vergleichen lässt

Quelle: Offizielle HF-Modellkarte zai-org/GLM-5.3 samt Lizenzdatei, Z.ai-Ankündigung vom 14.08.2026 und Freigabe der Gewichte vom 28.08.2026, dazu Berichte von VentureBeat, MarkTechPost und explainx · Stand der Recherche 16. September 2026 · die Bewertung ist eine redaktionelle Einschätzung von neuost