Wissen
KI-Modelle
im Vergleich.
Vergleiche Sprachmodelle für den Betrieb auf eigener Hardware oder bei einem europäischen Hoster. Die Übersicht zeigt Leistungsbewertungen, Lizenzen und Angaben zum Hardwarebedarf.
25 Modelle, Stand 16. September 2026
Die Modelle mit offenen Gewichten
Ein Klick auf eine Spaltenüberschrift sortiert danach, ein zweiter dreht die Reihenfolge um. Der Modellname führt auf die ausführliche Seite. Voreingestellt ist die Gesamtbewertung.
| # | Modell | Bewertung | Leistung | Coding | DSGVO / EU | Lizenz | Kontext | Lokal ab |
|---|---|---|---|---|---|---|---|---|
| GLM-5.2 Zhipu AI (Z.ai) · CN 744 Mrd. · 40 Mrd. aktiv | 94 % | 95 % | 92 % | 88 % | MIT | 1 Mio. Token | Mehrere RTX PRO 6000 (96 GB), Mac Studio oder H200 | |
| DeepSeek V4.1 Flash DeepSeek · CN 552 Mrd. · 8 bis 16 Mrd. aktiv | 93 % | 96 % | 96 % | 84 % | MIT | 1 Mio. Token | Server mit 8 GPUs (H200/B200), die Gewichte belegen 510 GB | |
| DeepSeek V4 Pro DeepSeek · CN 1,6 Bio. · 49 Mrd. aktiv | 92 % | 95 % | 93 % | 82 % | MIT | 1 Mio. Token | Mehrere RTX PRO 6000, Rechenzentrum (H200/B200) | |
| GLM-5.3 Zhipu AI (Z.ai) · CN 744 Mrd. · 40 Mrd. aktiv | 92 % | 96 % | 95 % | 84 % | GLM-5.3 License | 1 Mio. Token | Mehrere RTX PRO 6000 (96 GB), Mac Studio oder H200 | |
| GLM-5.3-Flash Zhipu AI (Z.ai) · CN 320 Mrd. · 18 Mrd. aktiv | 92 % | 95 % | 93 % | 84 % | MIT | 1 Mio. Token | Server mit 8 GPUs (H100/H200) oder ein GB200-Einschub | |
| Kimi K3 Moonshot AI · CN 2,8 Bio. · 104 Mrd. aktiv | 90 % | 96 % | 95 % | 82 % | Kimi K3 License | 1 Mio. Token | Rechenzentrum (mehrere B200/H200, 2,8 Bio. Parameter) | |
| Kimi K2.6 Moonshot AI · CN 1 Bio. · 32 Mrd. aktiv | 89 % | 91 % | 90 % | 85 % | Modified MIT | 256K Token | Mehrere RTX PRO 6000, Mac Studio (512 GB, ab Ende Oktober) oder H200 | |
| Inkling-Small Thinking Machines Lab · US 276 Mrd. · 12 Mrd. aktiv | 89 % | 88 % | 90 % | 84 % | Apache 2.0 | 1 Mio. Token | Workstation ab 128 GB Arbeitsspeicher (3-Bit-GGUF), unquantisiert 543 GB | |
| Qwen3.8-Max Alibaba (Qwen) · CN 2,4 Bio. · ~95 Mrd. aktiv | 89 % | 94 % | 93 % | 82 % | Qwen3.8-Max License | 1 Mio. Token | Rechenzentrum (mehrere B200/H200, 2,4 Bio. Parameter) | |
| Qwen3.8-27B Alibaba (Qwen) · CN 27,8 Mrd. · dicht | 89 % | 88 % | 90 % | 84 % | Apache 2.0 | 256K Token | Eine GPU (ab 24 GB, RTX 4090, Q4) | |
| Inkling Thinking Machines Lab · US 975 Mrd. · 41 Mrd. aktiv | 88 % | 89 % | 88 % | 80 % | Apache 2.0 | 1 Mio. Token | Rechenzentrum (NVFP4 rund 600 GB, bf16 rund 2 TB VRAM, mehrere B200) | |
| GLM-5.1 Zhipu AI (Z.ai) · CN 754 Mrd. · 40 Mrd. aktiv | 88 % | 87 % | 86 % | 84 % | MIT | 203K Token | Mehrere RTX PRO 6000 (96 GB), Mac Studio oder H200 | |
| Qwen3.8-Flash-Next Alibaba (Qwen) · CN 125 Mrd. · 6 Mrd. aktiv | 88 % | 93 % | 92 % | 84 % | Qwen Community License 1.0 | 256K Token | Workstation mit 96-GB-Karte und Auslagerung, unkomprimiert 4 bis 8 GPUs | |
| Kimi K2.7-Code Moonshot AI · CN 1 Bio. · 32 Mrd. aktiv | 87 % | 89 % | 94 % | 82 % | Modified MIT | 256K Token | Mehrere RTX PRO 6000, Mac Studio oder H200 | |
| Qwen 3.5 Alibaba (Qwen) · CN 397 Mrd. · 17 Mrd. aktiv | 87 % | 85 % | 84 % | 84 % | Apache 2.0 | 256K Token | Mehrere RTX PRO 6000 (96 GB) oder Mac Studio (512 GB, ab Ende Oktober) | |
| Laguna S 2.1 Poolside · US 118 Mrd. · 8 Mrd. aktiv | 86 % | 84 % | 90 % | 84 % | OpenMDW-1.1 | 1 Mio. Token | Eine RTX PRO 6000 (96 GB), DGX Spark oder Mac Studio (4 Bit, rund 59 GB) | |
| Muse Glimmer 30B Meta (Superintelligence Labs) · US 30 Mrd. · dicht | 86 % | 83 % | 84 % | 86 % | Apache 2.0 | 128K Token | Eine GPU (ab 24 GB, RTX 5090, 4-Bit) oder Mac mit M4/M5 Max | |
| Gemma 4 31B Google · US 31 Mrd. · dicht | 86 % | 82 % | 72 % | 86 % | Apache 2.0 | 256K Token | Eine GPU (24 GB, RTX 4090) | |
| Agents-A1 InternScience (Shanghai AI Lab) · CN 35 Mrd. · 3 Mrd. aktiv | 85 % | 81 % | 76 % | 85 % | Apache 2.0 | 256K Token | Workstation mit ~40 GB Speicher oder Mac mit viel Unified Memory (M5 Max); Q4 auch auf einer 24-GB-GPU | |
| Ornith 1.5 35B-A3B Ornith (DeepReinforce) · unklar 36 Mrd. · 3 Mrd. aktiv | 85 % | 82 % | 84 % | 84 % | MIT | 256K Token | Eine GPU (ab 24 GB, RTX 4090, Q4) | |
| Qwen3.6-35B-A3B Alibaba (Qwen) · CN 35 Mrd. · 3 Mrd. aktiv | 84 % | 78 % | 74 % | 88 % | Apache 2.0 | 256K Token | Eine GPU (ab 24 GB, RTX 4090, Q4) | |
| Gemma 4 26B-A4B Google · US 25 Mrd. · 3,8 Mrd. aktiv | 84 % | 79 % | 70 % | 86 % | Apache 2.0 | 256K Token | Eine GPU (Consumer, läuft dank 3,8 Mrd. aktiv schnell) | |
| MiniMax M3 MiniMax · CN 428 Mrd. · 23 Mrd. aktiv | 83 % | 90 % | 88 % | 80 % | MiniMax Community License | 1 Mio. Token | Mehrere RTX PRO 6000, Mac Studio oder B300/H200 | |
| GLM-4.7 Flash Zhipu AI (Z.ai) · CN 30 Mrd. · 3 Mrd. aktiv | 82 % | 76 % | 82 % | 84 % | MIT | 200K Token | Eine GPU (ab 18 GB, RTX 4090/3090, 4-Bit) | |
| Nemotron 3 Super NVIDIA · US 120 Mrd. · 12 Mrd. aktiv | 82 % | 85 % | 82 % | 78 % | NVIDIA Nemotron Open Model License | 1 Mio. Token | Eine RTX PRO 6000 (96 GB, FP8) oder H100 |
Kein Modell gefunden.
Die Prozentwerte sind eine redaktionelle Einschätzung von neuost auf Basis dokumentierter Benchmarks und Modellkarten, Stand 16. September 2026. Die zugrunde liegenden Benchmark-Zahlen sind bei den meisten Modellen Hersteller-Angaben, Details stehen auf der jeweiligen Modellseite. Mehr zur Methodik unter Wie wir bewerten.
Wo die Modelle stark sind
Neben der Gesamtnote zeigen wir für jedes Modell ein Fähigkeitsprofil aus 6 Säulen. So siehst du auf einen Blick, welches Modell in welchem Bereich führt. Jede Säule reicht von 0 bis 100. Wie die Säulen entstehen
| Modell | Programmierung | Mathematik & Logik | Wissen | Deutsch & Sprache | Agentik & Werkzeuge | Langer Kontext |
|---|---|---|---|---|---|---|
| GLM-5.2 CN | 91 | 98 | 92 | 82* | 90 | 88* |
| DeepSeek V4.1 Flash CN | 97 | 95 | 86 | 82* | 98 | 92* |
| DeepSeek V4 Pro CN | 94 | 92* | 95 | 84* | 88* | 92 |
| GLM-5.3 CN | 94* | 90* | 90* | 82* | 93* | 88* |
| GLM-5.3-Flash CN | 92 | 86* | 88* | 82* | 93 | 90* |
| Kimi K3 CN | 93 | 92* | 94 | 84* | 93 | 90* |
| Kimi K2.6 CN | 87 | 88* | 91 | 84* | 89 | 82* |
| Inkling-Small US | 90 | 95 | 78 | 82 | 92 | 86* |
| Qwen3.8-Max CN | 93 | 90* | 93 | 85* | 93 | 90* |
| Qwen3.8-27B CN | 89 | 92* | 89 | 88* | 88 | 84* |
| Inkling US | 86 | 96 | 80 | 78* | 90 | 86* |
| GLM-5.1 CN | 84 | 95 | 86 | 80* | 72 | 78* |
| Qwen3.8-Flash-Next CN | 92 | 88 | 92 | 85* | 91 | 86* |
| Kimi K2.7-Code CN | 92 | 82* | 80* | 82* | 88 | 82* |
| Qwen 3.5 CN | 84 | 86* | 93 | 88* | 80* | 82* |
| Laguna S 2.1 US | 89 | 70* | 72* | 72* | 80 | 85* |
| Muse Glimmer 30B US | 84 | 94 | 88 | 86* | 70 | 74* |
| Gemma 4 31B US | 76 | 89 | 89 | 90* | 70* | 80* |
| Agents-A1 CN | 78 | 82* | 84 | 78* | 85 | 82* |
| Ornith 1.5 35B-A3B unklar | 85 | 80* | 92 | 78* | 80 | 80* |
| Qwen3.6-35B-A3B CN | 78 | 93 | 90 | 87* | 72* | 82* |
| Gemma 4 26B-A4B US | 73 | 88 | 86 | 90* | 68* | 78* |
| MiniMax M3 CN | 87 | 82* | 80* | 82* | 86 | 86* |
| GLM-4.7 Flash CN | 76 | 92 | 76 | 78* | 72* | 74* |
| Nemotron 3 Super US | 80* | 80* | 78* | 76* | 92 | 88* |
Ein Klick auf eine Säule ordnet die Matrix danach. Umrandet ist je Säule der Spitzenwert. Ein * markiert eine redaktionelle Einschätzung, weil für diese Säule bei diesem Modell kein vergleichbarer Benchmark vorlag. Mehr dazu unter Wie wir bewerten.
Modelle direkt vergleichen
Leg bis zu 3 Fähigkeitsprofile übereinander und sieh, wo eines dem anderen voraus ist.
| Säule |
|---|
* redaktionelle Einschätzung, kein belegter Benchmark. Zur Methodik
Sprachmodelle auf eigener Hardware betreiben
Offene Modellgewichte ermöglichen den Betrieb eines Sprachmodells auf eigener Hardware. Für die Auswahl zählen die Qualität bei euren Aufgaben, die Lizenzbedingungen und der Aufwand für Einrichtung und Betrieb.
Beim lokalen Betrieb lässt sich festlegen, in welcher Infrastruktur Daten verarbeitet werden. Datenschutzrechtliche Anforderungen hängen zusätzlich vom Zweck, den Zugriffsrechten, den beteiligten Diensten und der konkreten Einrichtung ab.
Für die Bewertung eines Betriebsmodells sind Herkunft, Lizenz und tatsächliche Datenwege getrennt zu betrachten. Ein heruntergeladenes Modell und ein Cloudzugang desselben Herstellers können unterschiedlich eingebunden sein. Prüft, welche Dienste eure Anwendung tatsächlich kontaktiert.
Wie wir bewerten
Die Gesamtbewertung fasst unsere redaktionellen Einschätzungen zu Leistung, Betriebsbedingungen und Lizenz zusammen. Die Prozentwerte sind keine Messung der Rechtskonformität. Die Gewichtung zeigt, wie die Gesamtnote zustande kommt.
Leistung
55 %Aggregierte Stärke aus dokumentierten Benchmarks für Programmierung (SWE-bench, LiveCodeBench), Reasoning (GPQA Diamond, AIME) und Wissen. Als unabhängige Orientierung gleichen wir diese Einschätzung grob mit dem Arena-Elo von arena.ai ab, übernehmen es aber nicht eins zu eins. Die Benchmark-Zahlen selbst sind bei den meisten Modellen Hersteller-Angaben, für 11 der 25 Modelle liegt zusätzlich eine unabhängige Einordnung durch Artificial Analysis vor. Auf jeder Modellseite ist das ausgewiesen.
DSGVO- und EU-Eignung
30 %In diese redaktionelle Bewertung fließen der mögliche lokale Betrieb, die belegte Verfügbarkeit bei europäischen Hostern und die Herkunft des Anbieters ein. Der Wert besagt nicht, ob eine konkrete Anwendung die DSGVO erfüllt. Dafür müssen die tatsächlichen Datenwege und die Bedingungen des Einsatzes geprüft werden.
Lizenz-Offenheit
15 %Die erlaubte Nutzung und die einzuhaltenden Bedingungen ergeben sich aus dem jeweiligen Lizenztext. Unsere Bewertung berücksichtigt die Möglichkeiten zur kommerziellen Nutzung, Anpassung und Weitergabe. Sie ersetzt nicht die Prüfung der Lizenz für euren Einsatz.
Der Hardware-Aufwand fließt bewusst nicht in die Note ein, sondern steht als eigene Spalte. Ein Modell, das ein Rechenzentrum braucht, ist nicht schlechter als eines für eine einzelne Grafikkarte. Es passt nur zu einem anderen Budget. Sortiere die Tabelle nach der Spalte Lokal ab, wenn die Hardware für dich der entscheidende Punkt ist.
Das Fähigkeitsprofil aus 6 Säulen
Die Gesamtnote fasst unsere Bewertung zusammen. Welche Aufgaben ein Modell bearbeiten kann, zeigt das Fähigkeitsprofil aus 6 Säulen. Es ist unabhängig von der Gesamtnote und ändert diese nicht. Jede Säule stützt sich auf etablierte, öffentlich dokumentierte Benchmarks:
Programmierung
Code schreiben und debuggen, ganze Repositories über viele Schritte bearbeiten.
Benchmarks: SWE-bench, LiveCodeBench, Terminal-Bench
Mathematik & Logik
mehrstufiges Rechnen und logisches Schließen mit prüfbarer Lösung.
Benchmarks: AIME, HMMT, IMO/ICPC
Wissen
Fach- und Allgemeinwissen über viele Domänen hinweg.
Benchmarks: MMLU-Pro, GPQA Diamond
Deutsch & Sprache
Sprachverständnis und Mehrsprachigkeit, mit Blick auf Deutsch.
Benchmarks: MMMLU, Belebele (meist redaktionell, da selten berichtet)
Agentik & Werkzeuge
Werkzeuge selbständig aufrufen und mehrstufige Abläufe steuern.
Benchmarks: Terminal-Bench, τ-bench, BFCL, PinchBench
Langer Kontext
nutzbare Leistung über sehr lange Eingaben, nicht nur die Fenstergröße.
Benchmarks: NIAH, MRCR, RULER
Damit sich Benchmarks mit unterschiedlichen Skalen vergleichen lassen, rechnen wir jeden Rohwert baseline-korrigiert auf 0 bis 100 um, nach der Methode des HuggingFace Open LLM Leaderboards v2. Die Baseline ist die Ratewahrscheinlichkeit eines Benchmarks, bei einer Multiple-Choice-Aufgabe mit 4 Optionen also 25 %. Ein Wert darunter zählt als 0. So ist ein 30-%-Ergebnis bei reinem Raten nichts wert, ein 30-%-Ergebnis bei einer generativen Aufgabe dagegen echt. Die Formel:
Wert = ( Rohwert − Baseline ) ÷ ( Maximum − Baseline ) × 100
Liegen für eine Säule mehrere Benchmarks vor, mitteln wir die normalisierten Werte. Ein solcher Wert ist im Profil als belegt gekennzeichnet. Fehlt für eine Säule ein vergleichbarer Benchmark, steht dort eine redaktionelle Einschätzung, im Radar mit einem Sternchen markiert. Das betrifft vor allem die Säule Deutsch und Sprache, denn deutschsprachige Suiten wie MMMLU-DE oder Belebele werden von den Herstellern bislang kaum berichtet, weshalb wir die Deutsch-Stärke aus der dokumentierten Sprachabdeckung und dem Gesamtbild einordnen, statt eine Zahl vorzutäuschen. Wie bei den Benchmarks der Tabelle sind die meisten Rohwerte Hersteller-Angaben ohne unabhängige Verifikation. Für eine belastbare Entscheidung ersetzt das Profil keinen eigenen Test im konkreten Anwendungsfall.
Hardwarebedarf und Betriebsaufwand
In der Spalte "Lokal ab" nennen wir die nötige Hardware-Klasse. Unser Maßstab ist eine Workstation, die ein Unternehmen als einzelnes Gerät anschafft. Rechenzentrums-Karten wie H100, A100 oder B200 sind teuer und selten praktikabel. Sie sind nur in Ausnahmefällen nötig, etwa bei sehr hohem Durchsatz mit vielen gleichzeitigen Anfragen.
NVIDIA RTX PRO 6000
96 GB Grafikspeicher
Die stärkste Einzelkarte für lokale KI, mit voller CUDA-Unterstützung. Auf einer Karte laufen die meisten mittelgroßen Modelle, auf 2 bis 3 davon auch die größeren, allerdings mit sehr starker Quantisierung. Vor einer Anschaffung sollten Speicherbedarf, Geschwindigkeit und laufende Kosten für die vorgesehenen Aufgaben geprüft werden.
Apple Mac Studio M5 Ultra
bis 256 GB, für sehr große Modelle
Durch das große Unified Memory laufen selbst Modelle mit über 200 Milliarden Parametern ohne starke Quantisierung, ganz ohne Server. Seit August 2026 liest der M5 Ultra den Speicher mit 1,2 TB/s aus. Bei den größten Modellen fällt die Geschwindigkeit trotzdem spürbar ab, für viele produktive Anwendungen zu weit.
NVIDIA DGX Spark
128 GB, kompakter Desktop
Ein kompakter Desktop-Rechner mit GB10-Superchip und gemeinsamem Speicher aus CPU und GPU. Bringt CUDA und server-ähnliche Leistung auf den Schreibtisch, geeignet für kleinere und mittlere Modelle.
Wer keine eigene Hardware anschaffen will, nutzt dieselben Modelle über einen europäischen Hoster und zahlt je Anfrage. Welche Karte zu welcher Modellgröße passt, rechnen wir mit dir durch.
Betrieb auf eigener Hardware oder bei einem EU-Hoster
Selbst betreiben
Du betreibst das Modell auf eigener Hardware, im Serverraum oder auf einer Workstation. Die Verarbeitung bleibt vollständig im Unternehmen. Das ist die strengste Form der Datensouveränität und ab dauerhaft hoher Nutzung auch wirtschaftlich, weil keine Kosten je Anfrage anfallen.
Für den Einstieg eignen sich Modelle, die auf einer einzelnen Grafikkarte laufen, etwa Qwen3.8-27B, Muse Glimmer 30B oder Gemma 4 31B. Wer mehr Leistung braucht, plant eine Workstation-Karte wie die RTX PRO 6000 mit 96 GB ein, für die größten Modelle mehrere davon oder einen Mac Studio.
Bei einem EU-Hoster nutzen
Du nutzt das Modell über eine API, gehostet in der EU. Anbieter wie IONOS in Deutschland, OVHcloud und Scaleway in Frankreich oder Nebius in den Niederlanden übernehmen den Betrieb. Du zahlst je Anfrage und brauchst keine eigene Hardware.
Die Auswahl wächst, hinkt bei den allerneuesten Modellen aber noch hinterher. GLM-5.2 läuft bei Scaleway, Kimi K2.6 bei Nebius, Qwen 3.6 bei mehreren Anbietern. Welche Modelle ein Anbieter heute führt, steht in seinem Katalog.
Welcher Weg passt, hängt von Datenmenge, Nutzungsintensität und vorhandenem technischen Wissen ab. Wir helfen bei der Auswahl und beim Aufbau. Ein Überblick über die passenden Werkzeuge steht in unserer Übersicht zur lokalen Inferenz und der KI-Hardware.
Häufige Fragen zu lokalen KI-Modellen
Welches lokale KI-Modell ist aktuell das beste?
Nach unserer Bewertung führt GLM-5.2 von Zhipu AI (Z.ai) das Feld an. Es liefert die stärksten dokumentierten Werte bei Programmierung und Reasoning und steht unter einer freien Lizenz. Welches Modell für dich das richtige ist, hängt aber stark von deiner Hardware ab. Ein Modell wie Qwen3.8-27B läuft auf einer einzelnen Grafikkarte, GLM-5.2 braucht eine Workstation oder einen Server. Sortiere die Tabelle nach der Spalte Lokal ab, wenn die Hardware für dich entscheidend ist.
Sind chinesische KI-Modelle wie GLM, Qwen oder Kimi DSGVO-konform?
Ob eine KI-Anwendung datenschutzkonform eingesetzt werden kann, hängt von ihrer konkreten Einrichtung und Verwendung ab. Prüft die Datenwege, angeschlossenen Dienste und vertraglichen Bedingungen. Weder das Herkunftsland des Modells noch ein europäischer Serverstandort entscheidet diese Frage allein.
Stimmen die Benchmark-Werte in der Tabelle?
Wir geben die dokumentierten Werte an und kennzeichnen ihre Herkunft. Bei den meisten Modellen stammen die Benchmark-Zahlen vom Hersteller selbst, eine unabhängige Verifikation liegt oft noch nicht vor. Für 11 der 25 Modelle liegt eine unabhängige Einordnung durch Artificial Analysis vor, darunter GLM-5.3-Flash, Qwen3.8-Flash-Next und Kimi K3. Auf der jeweiligen Modellseite weisen wir das aus. Für eine belastbare Entscheidung empfehlen wir einen eigenen Test im konkreten Anwendungsfall.
Was brauche ich, um ein KI-Modell lokal zu betreiben?
Das hängt vom Modell ab. Kleinere Modelle wie Qwen3.8-27B, Muse Glimmer 30B oder Gemma 4 31B laufen auf einer einzelnen Grafikkarte und sind der realistische Einstieg. Mittelgroße Modelle wie Qwen3.8-Flash-Next oder Laguna S 2.1 laufen auf einer Workstation-Karte wie der RTX PRO 6000 mit 96 GB, also auf einem einzelnen Gerät statt in einem Serverraum. Die großen Modelle wie GLM-5.2, DeepSeek V4 Pro oder MiniMax M3 brauchen mehrere solcher Karten, einen Mac Studio mit viel Unified Memory oder einen Server. Rechenzentrums-GPUs wie H100, A100 oder B200 sind nur in Ausnahmefällen nötig. In unserer Tabelle steht zu jedem Modell die nötige Hardware-Klasse.
Lohnt es sich, die größten Modelle selbst zu betreiben?
Meist nicht. Die schwersten Modelle wie DeepSeek V4 Pro oder Kimi K2.6 lassen sich auf eigener Hardware betreiben, aber nur mit sehr großem Aufwand. Nötig sind mehrere Server- oder Workstation-Grafikkarten, dazu hohe Anschaffungs- und Stromkosten und laufende Wartung. Selbst das in unserer Bewertung führende GLM-5.2 braucht bereits eine Workstation. Die erste Frage ist deshalb, ob du ein solches Modell überhaupt brauchst. Häufig deckt ein kleineres Modell den konkreten Anwendungsfall vollständig ab. Wenn es tatsächlich eines der größten Modelle sein muss, ist der praktikable Weg fast immer ein europäischer Hoster.
Kann ich diese Modelle bei einem deutschen oder europäischen Hoster nutzen?
Ja, und das ist der einfachste Weg ohne eigene Hardware. Anbieter wie IONOS in Deutschland, OVHcloud und Scaleway in Frankreich oder Nebius in den Niederlanden stellen offene Modelle über eine API bereit, gehostet in der EU. Welche Modelle ein Anbieter führt, unterscheidet sich deutlich. Die Auswahl wächst, hinkt bei den allerneuesten Modellen aber noch etwas hinterher, deshalb lohnt vor der Entscheidung ein Blick in seinen Katalog.
Was bedeutet die Gesamtbewertung?
Die Bewertung ist eine redaktionelle Einschätzung von neuost. Leistung zählt 55 %, gemessen an dokumentierten Benchmarks und grob abgeglichen mit dem Arena-Elo von arena.ai, DSGVO- und EU-Eignung zählt 30 %, Lizenz-Offenheit 15 %. Die Prozentwerte messen keine Rechtskonformität. Der Hardware-Aufwand steht als eigene Spalte. Du kannst die Tabelle nach jeder Spalte sortieren und so die für dich wichtige Eigenschaft nach oben holen.
Aktualisierung und Rückmeldungen
Wir aktualisieren die Übersicht, wenn sich Modelle oder die verfügbaren Daten ändern. Ist dir eine veraltete Angabe aufgefallen oder fehlt ein Modell? Schreib uns an hallo@neuost.ai.