Zum Inhalt springen
Alle Beiträge Lokale KI

Gemma 4 vs. Qwen 3.6 im Unternehmenstest: Googles und Alibabas offene KI-Modelle im Vergleich

Google hat Anfang April 2026 Gemma 4 unter Apache 2.0 veröffentlicht, Alibaba 2 Wochen später Qwen 3.6 35B-A3B. Nach 2 Wochen Parallelbetrieb schreibt Gemma 4 das bessere Deutsch, Qwen 3.6 den besseren Code.

Ralf Cornesse 9 Minuten Lesezeit
Titelgrafik von gewusst:KI mit dem Schriftzug Gemma 4 vs. Qwen 3.6 zum Vergleich der offenen KI-Modellfamilien von Google und Alibaba für den Einsatz im Unternehmen

Am 02.04.2026 hat Google Gemma 4 veröffentlicht, in 4 Varianten und erstmals unter Apache 2.0. Wir haben die beiden großen 2 Wochen lang neben Qwen 3.5 von Alibaba laufen lassen. In den Messwerten trennt die beiden wenig, im Deutschen deutlich mehr.

Das 31B Dense steht auf Platz 3 der Arena-Rangliste für offene Modelle, das kleinere 26B MoE auf Platz 6. Die starken offenen Modelle der vergangenen Monate kamen fast alle aus China, etwa Qwen von Alibaba, GLM-5.1 von Z.ai oder DeepSeek-V3. Google ist mit Gemma 4 auf diese Liste zurückgekehrt.

4 Varianten für 4 Größen von Gerät

Variante Parameter Speicherbedarf Wofür
E2B 2 Mrd. rund 1,3 GB verkleinert Tablets, Industriepanels, eingebaute Geräte. Versteht Text, Bilder und gesprochene Sprache
E4B 4 Mrd. rund 2,5 GB Servicegeräte, Kassensysteme, mobile Erfassung. Deutlich stärker bei Bildaufgaben und Funktionsaufrufen
26B MoE 26 Mrd., davon 3,8 aktiv eine Grafikkarte im Arbeitsplatz Assistent für den laufenden Tag mit vielen kurzen Anfragen
31B Dense 31 Mrd. eine H100 mit 80 GB oder eine entsprechende Workstation ausführliche Analysen und das Nachtrainieren auf eigene Texte

Die beiden Edge-Varianten sind für Geräte gedacht, die keine Grafikkarte haben und oft auch kein Netz. E2B belegt verkleinert rund 1,3 GB und läuft damit auf einem gewöhnlichen Tablet. E4B hat doppelt so viele Parameter, kommt auf rund 2,5 GB und macht bei Bildern und beim Aufrufen von Funktionen einen deutlichen Sprung, weshalb es die Wahl für Servicegeräte und für die Erfassung vor Ort ist.

Das 26B MoE hat in unserem Test das beste Verhältnis aus Qualität und Antwortzeit. Von seinen 26 Milliarden Parametern rechnen nur 3,8 pro Anfrage, und deshalb antwortet es schnell genug, dass man beim Tippen nicht wartet, liefert aber die Qualität eines deutlich größeren Modells. Das 31B Dense rechnet dagegen mit allen Parametern. Es braucht eine H100 mit 80 GB oder eine entsprechend bestückte Workstation, liefert die besseren Ergebnisse, wenn eine Analyse über mehrere Schritte läuft, und ist die erste Wahl, wenn ein Modell auf eigene Texte nachtrainiert werden soll.

Was Gemma 4 von Gemma 3 unterscheidet

Alle 4 Varianten verarbeiten Text, Bilder und Videos in einem einzigen Modell, ohne dass ein zweites System für die Bilder danebenstehen muss. E2B und E4B verstehen zusätzlich gesprochene Sprache, was sie für Assistenten am Telefon und für die Dokumentation unterwegs brauchbar macht.

Das Kontextfenster fasst 256.000 Token, doppelt so viel wie bei Gemma 3. Das reicht für mehrere hundert Seiten Dokumentation in einer Anfrage. Dazu kommt ein Denkmodus, der sich je Aufgabe zuschalten lässt: Kurze Antworten bleiben schnell, schwierige Aufgaben bekommen mehr interne Zwischenschritte.

Die größte Änderung ist die Lizenz. Frühere Gemma-Versionen liefen unter einer eigenen Google-Lizenz mit Nutzungsbeschränkungen, die Google jederzeit ändern konnte. Gemma 4 steht unter Apache 2.0, einer Lizenz, die jede Rechtsabteilung kennt und die den kommerziellen Einsatz ohne Rückfrage erlaubt.

Gemma 4 und Qwen 3.5 nebeneinander

Beide Modellreihen stehen unter Apache 2.0, beide verarbeiten Bilder, beide haben Varianten für Arbeitsplatz und Server.

Kriterium Gemma 4 (31B Dense) Qwen 3.5 (27B Dense)
Arena-ELO 1452, Platz 3 nahe dran
Programmieren (LiveCodeBench) 80,0 % 80,7 %
Mathematik (AIME 2026) 89,2 % vergleichbar
Kontextfenster 256.000 Token 262.000 Token
Sprachen 140 201
Schwerpunkt logisches Denken, Agenten, Werkzeugaufrufe Programmieren, Mehrsprachigkeit

Der Unterschied, der im Alltag zählt, steht nicht in dieser Tabelle. Gemma 4 formuliert auf Deutsch spürbar natürlicher als Qwen 3.5. Die Sätze wirken weniger übersetzt, die Wortwahl ist genauer, und der Ton passt zu geschäftlicher Korrespondenz. Bei einem Antwortentwurf an einen Kunden hieß das in unserem Test, dass wir bei Gemma 4 noch am Inhalt gearbeitet haben und bei Qwen 3.5 zuerst an der Sprache.

Qwen 3.5 bleibt der stärkere Programmierassistent, vor allem das 27B Dense. Muss ein Unternehmen viele Sprachen abdecken, sprechen die 201 unterstützten Sprachen für Qwen. Unsere Faustregel für Kunden: Gemma 4 für deutsche Textarbeit, Qwen für internationale Dokumente und für Entwicklerteams.

Am 16.04.2026 hat Alibaba den Nachfolger Qwen 3.6 35B-A3B unter Apache 2.0 veröffentlicht, mit 35 Milliarden Parametern und 3 Milliarden aktiv. Die größere Qwen 3.6 Plus ist nicht offen und nur über die Alibaba-Cloud erreichbar.

Beim Programmieren holt Qwen damit deutlich auf. Auf SWE-bench Verified erreicht Qwen 3.6 35B-A3B 73,4 %, gegenüber 70,0 % beim Vorgänger und 52,0 % bei Gemma 4-31B. Auf AIME 2026 liegt Qwen 3.6 bei 92,7 % und Gemma 4 bei 89,2 %. An der Empfehlung oben ändert das nichts: Für deutsche Textarbeit bleibt Gemma 4 vorn. Wer viel Code erzeugen lässt oder Abläufe baut, die das Modell selbst abarbeitet, sollte Qwen 3.6 35B-A3B ausprobieren.

Nemotron 3 Super spielt in einer anderen Größenklasse

Nemotron 3 Super von NVIDIA hat 120 Milliarden Parameter, davon 12 Milliarden aktiv, ein Kontextfenster von 1 Million Token und eine gemischte Bauform aus Mamba-2, Transformer und Expertenaufteilung. Das ist ein Modell für den Serverraum.

NVIDIA hat es auf Abläufe ausgelegt, die ein Modell selbständig über viele Schritte abarbeitet. Auf dem PinchBench erreicht es 85,6 Punkte, mehr als jedes andere offene Modell. Wer solche Abläufe baut, in denen das Modell Werkzeuge aufruft, Datenbanken abfragt und Zwischenergebnisse aneinanderhängt, bekommt hier das stärkste offene Werkzeug. Bezahlt wird das mit dem Hardwarebedarf und mit einer engeren Lizenz, denn die NVIDIA Open Model License erlaubt den kommerziellen Einsatz, ist aber kein Apache 2.0.

In unseren Projekten reicht Gemma 4 für alles außerhalb der Softwareentwicklung. Nemotron lohnt sich, wenn eigene Grafikkarten im Rechenzentrum stehen und Abläufe über hunderttausende Token koordiniert werden. Darunter läuft Gemma 4 billiger und auf deutlich weniger Hardware.

GLM-5.1 kostet eine sechsstellige Maschine

GLM-5.1 von Z.ai ist Anfang April 2026 erschienen und war beim Programmieren damals das stärkste offene Modell. Auf dem SWE-bench Pro erreicht es 58,4 Punkte und lag damit vor GPT-5.4 und Claude Opus 4.6. Der Nachfolger GLM-5.2 kommt inzwischen auf 62,1 Punkte.

Für den Betrieb auf eigener Hardware braucht GLM-5.1 mindestens 8 große Grafikkarten. Es hat 744 Milliarden Parameter, davon 40 Milliarden aktiv, und ein Kontextfenster von 200.000 Token. Eine passende Maschine kostet eine sechsstellige Summe, während man bei einem europäischen Anbieter für dasselbe Modell je Anfrage zahlt. Der Kauf rechnet sich erst, wenn die Karten auch nachts und am Wochenende Anfragen abarbeiten.

In unseren Projekten ergänzen sich die beiden. GLM-5.1 übernimmt die Entwicklungsarbeit an großen Codebeständen, sofern die Infrastruktur dafür da ist. Gemma 4 übernimmt den Rest, also Texte, Analysen, Bildauswertung und Kundenanfragen. Ein Unternehmen mit eigener Softwareentwicklung kann beide nebeneinander betreiben.

Wofür wir Gemma 4 einsetzen

Die 4 Varianten decken sehr verschiedene Fälle ab. In unseren Projekten sind es derzeit diese 5.

  1. Als internen Assistenten für Büroarbeit betreiben wir das 26B MoE auf einer Arbeitsstation oder einem kleinen Server und hängen eine Chat-Oberfläche davor. Die Leute formulieren damit Mails, lassen Dokumente zusammenfassen und schreiben Berichtsentwürfe. Wegen der deutschen Sprachqualität geht das Ergebnis oft direkt an den Kunden, statt vorher noch einmal durch die Hand des Verfassers zu laufen.
  2. Weil Gemma 4 Bilder selbst versteht, wertet es gescannte Dokumente, Formulare, Baustellenfotos und Prüfprotokolle aus. Zusammen mit einem RAG-System wird daraus ein durchsuchbarer Aktenbestand.
  3. Beide großen Varianten rufen Funktionen im Zielsystem auf. Ein Ablauf, der eine Anfrage einsortiert, Angaben aus der Kundenverwaltung und dem Warenwirtschaftssystem holt und dem Mitarbeiter einen fertigen Antwortentwurf hinlegt, läuft mit Gemma 4 im Betrieb und antwortet in gutem Deutsch.
  4. Das 31B Dense nimmt eigenes Material besonders gut an. Unternehmen mit eigenem Fachvokabular in Medizin, Recht oder Bauwesen trainieren es damit nach und setzen es danach im Alltag ein.
  5. E2B und E4B laufen ohne Netz auf Tablets, Servicegeräten und Industriepanels. Für den Außendienst, für Wartungsarbeiten und für Kundendienst ohne Empfang ist das die praktische Lösung, und weil sie Sprache verstehen, lassen sie sich dabei ansprechen statt bedienen.

Was die Lizenz für Ausschreibungen ändert

Frühere Gemma-Versionen liefen unter einer eigenen Google-Lizenz mit Nutzungsbeschränkungen, die Google jederzeit ändern konnte. Für eine Rechtsabteilung ist das eine Bedingung, die sich nicht prüfen lässt, weil sie sich morgen anders lesen kann, und manche hat das zum Anlass genommen, gleich auf Qwen oder Mistral zu wechseln. Apache 2.0 kennt dagegen jede Rechtsabteilung, der Text ist seit Jahren unverändert, und die Freigabe für den kommerziellen Einsatz kostet keine Rückfrage.

Dazu kommt die Herkunft. Hinter Gemma 4 steht ein amerikanischer Konzern mit der Forschung von DeepMind, während die starken offenen Modelle der letzten 12 Monate fast alle aus China kamen. Technisch sind diese Modelle oft auf Augenhöhe und in einzelnen Disziplinen voraus, das ist im Vergleich oben nachzulesen. In Ausschreibungen von Behörden, in Verträgen mit Versicherern und bei Prüfungen großer Konzerne wird die Herkunft eines Modells aber zunehmend abgefragt, unabhängig davon, wie es abschneidet. Für diese Fälle gibt es mit Gemma 4 jetzt eine zweite Antwort.

Wie du Gemma 4 ausprobierst

Beide großen Varianten sind seit dem Erscheinungstag über Ollama verfügbar. Der Einstieg ist ein einziger Befehl.

# 26B MoE herunterladen und starten
ollama run gemma4:26b

# Edge-Variante für Tablets oder eingebaute Geräte
ollama run gemma4:e4b

Wer lieber eine grafische Oberfläche hat, nimmt LM Studio oder Open WebUI. Beide unterstützen Gemma 4 seit der Veröffentlichung. Für einen ersten Eindruck reicht auch Google AI Studio, dort läuft das 31B kostenlos im Browser.

Der Schritt vom Testlauf zum Dienst, den das ganze Team nutzt, ist danach ein eigenes Stück Arbeit, vom Auslegen des Servers bis zu der Frage, wer die Updates einspielt. Welche der 4 Varianten zu deiner Hardware passt, lässt sich vor dem Kauf an den eigenen Aufgaben testen.

Was wir Kunden derzeit empfehlen

Baust du einen internen Assistenten, der vor allem deutsche Texte schreiben soll, fang mit Gemma 4 in der Variante 26B MoE an. Für Entwicklerteams ist seit dem 16.04.2026 Qwen3.6-35B-A3B die Referenz auf einer einzelnen Grafikkarte, mit 73,4 % auf SWE-bench Verified. Qwen 3.5 bleibt interessant, wo die 201 Sprachen den Ausschlag geben. Wer mehr Hardware stellen kann, kommt beim Programmieren und bei mehrstufigen Abläufen an GLM-5.2 und DeepSeek V4.1 Flash nicht vorbei, beide unter MIT-Lizenz.

Was wir in 2 Wochen Parallelbetrieb nicht geprüft haben, ist die Dauer. Wie sich ein Modell verhält, wenn 20 Leute es 6 Monate lang mit ihren echten Dokumenten füttern, sagt kein Testlauf und keine Rangliste voraus.

KI für eure Aufgaben einsetzen

Wir besprechen, welche Anwendungen zu euren Abläufen und Daten passen.