Kaufberatung, Stand September 2026
Hardware
für lokale KI.
Welche Hardware ihr benötigt, hängt vom Modell, euren Aufgaben und der gleichzeitigen Nutzung ab. Ausreichender Speicher ist besonders wichtig. Wir vergleichen die Ausstattung und erläutern, für welche Nutzung die Geräte infrage kommen.
30 Minuten, kostenlos, per Video oder vor Ort
Hardware nach Nutzungsbedarf vergleichen
Entscheidend sind die Zahl der Nutzer und die Größe der Modelle. Der Preis gilt für das genannte Gerät, alle Angaben dazu stehen weiter unten.
| Wenn bei euch | empfehlen wir | Preis |
|---|---|---|
| 1 Person arbeitet mit Modellen bis 35 Mrd. Parameter | Mac mini M5 Pro | ab 2.000 Euro |
| Dieselben Modelle, aber in vollem Tempo und mit CUDA | NVIDIA RTX 5090 | ab 5.250 Euro, nur die Karte |
| 1 Person braucht große Modelle, das Tempo ist zweitrangig | DGX Spark MacBook Pro M5 Max | 5.600 bis 7.700 Euro |
| Ein kleines Team braucht große Modelle in vollem Tempo | Mac Studio M5 Ultra NVIDIA RTX PRO 6000 | ab 8.000 Euro |
| 5 bis 20 Leute arbeiten gleichzeitig oder mehrere Modelle laufen nebeneinander | NVIDIA Multi-GPU Workstation | ab 35.000 Euro netto |
| Ihr wollt erst ausprobieren oder der Bedarf schwankt | Die 11 Hoster aus Europa NVIDIA H200 | 280 bis 2.500 Euro im Monat |
So viel Speicher braucht ein Modell
Faustregel: rund 0,6 GB Grafikspeicher je Milliarde Parameter, wenn das Modell in 4 Bit gespeichert ist. Bei der Quantisierung werden Modellwerte mit geringerer Genauigkeit gespeichert. Das reduziert den Speicherbedarf. Wie sich die Genauigkeit auf eure Ergebnisse auswirkt, sollte mit typischen Aufgaben geprüft werden. Die Beispiele stehen mit allen Werten im Vergleich der KI-Modelle.
| Grafikspeicher | Parameter | Beispiele | Läuft auf |
|---|---|---|---|
| 16 bis 24 GB | 22 bis 35 Mrd. | Qwen3.8-27B, Muse Glimmer 30B, Gemma 4 31B | RTX 5090, Mac mini M5 Pro |
| 32 bis 48 GB | 30 bis 40 Mrd. | Agents-A1, Ornith 1.5 35B-A3B | RTX 5090, MacBook Pro M5 Max |
| 56 bis 96 GB | 110 bis 125 Mrd. | Qwen3.8-Flash-Next, Laguna S 2.1, Nemotron 3 Super | RTX PRO 6000, DGX Spark, Mac Studio |
| 128 bis 256 GB | bis rund 280 Mrd. | Inkling-Small | MacBook Pro 128 GB, Mac Studio 256 GB |
| ab 384 GB | 500 Mrd. und mehr | GLM-5.3, Kimi K2.6, DeepSeek V4.1 Flash | Workstation mit 4 Karten, Server mit H200 |
Geräte und ihre Ausstattung
Jeder Name führt zu unserer Bewertung des Geräts.
| Gerät | Klasse | Speicher | Bandbreite | Preis | Passt für |
|---|---|---|---|---|---|
| NVIDIA RTX 5090 | Arbeitsplatzrechner | 32 GB | 1.792 GB/s | ab 5.250 Euro brutto, nur die Karte | Modelle bis rund 35 Mrd. Parameter. Günstigster Einstieg mit CUDA, kein Speicher mit Fehlerkorrektur. |
| NVIDIA RTX PRO 6000 | Arbeitsplatzrechner | 96 GB | 1.792 GB/s | ab 12.500 Euro netto, nur die Karte | Modelle bis rund 120 Mrd. Parameter. Als Einbaukarte nachrüstbar, braucht 600 W. |
| Apple Mac mini M5 Pro | Gemeinsamer Speicher | bis 64 GB | 307 GB/s | ab 1.999 Euro | Einstieg für 1 Person, Modelle bis rund 35 Mrd. Parameter. |
| NVIDIA DGX Spark | Gemeinsamer Speicher | 128 GB | 273 GB/s | rund 4.730 Euro netto | 128 GB gemeinsamer Speicher. Die erreichbare Geschwindigkeit hängt vom Modell und der Nutzung ab. 2 Geräte lassen sich koppeln. |
| Apple MacBook Pro M5 Max | Gemeinsamer Speicher | bis 128 GB | 614 GB/s | mit 128 GB ab 7.659 Euro | Modelle bis rund 120 Mrd. Parameter, auch unterwegs ohne Internet. |
| Apple Mac Studio M5 Ultra | Gemeinsamer Speicher | 96 oder 256 GB | 1,2 TB/s | ab 8.029 Euro mit 96 GB, 12.429 Euro mit 256 GB | Modelle bis rund 250 Mrd. Parameter mit Reserve für lange Dokumente. |
| NVIDIA Multi-GPU Workstation | Server mit mehreren Karten | bis 384 GB | 1.792 GB/s je Karte | ab 35.000 Euro mit 2 Karten, über 65.000 Euro mit 4 | 5 bis 20 Leute gleichzeitig oder mehrere Modelle nebeneinander. 4 Karten ziehen unter Last 2,4 kW und brauchen einen gekühlten Raum. |
| NVIDIA H200 | Miete | 141 GB | 4,8 TB/s | 3,40 bis 4,20 Euro je GPU-Stunde | Modelle ab 500 Mrd. Parameter. Kaufen lohnt selten, mieten bei einem Anbieter in der EU. |
Den ASUS Ascent GX10, baugleich mit dem DGX Spark, setzen wir selbst ein: Was das Gerät leistet und was nicht. Anbieter für die Miete stehen unter KI-Hoster aus Europa.
Häufige Fragen
Läuft lokale KI auch ohne Grafikkarte?
Ja. Geräte mit gemeinsamem Speicher haben keine Steckkarte, 128 GB gibt es ab rund 5.600 Euro. Auf einem Rechner mit 16 GB Arbeitsspeicher laufen die kleinen Modelle zum Ausprobieren, für mehrere Leute gleichzeitig reicht er nicht.
Kaufen oder mieten?
Vergleicht die Gesamtkosten für den geplanten Nutzungszeitraum. Beim Kauf zählen neben der Hardware auch Strom, Einrichtung und Betreuung. Bei der Miete sind Nutzungsdauer, Tarif und zusätzliche Kosten des Angebots relevant. Eine Beispielrechnung sollte alle Annahmen offenlegen.
Warum zählt der Speicher mehr als der Prozessor?
Für jedes Wort einer Antwort liest das Modell alle seine Zahlenwerte einmal aus dem Speicher. Wie schnell das geht, bestimmt die Speicherbandbreite: Grafikspeicher liefert bis zu 1.792 GB je Sekunde, normaler Arbeitsspeicher je nach Rechner ein Fünftel bis ein Zwanzigstel davon. Passt das Modell nicht in den Grafikspeicher, wird jede Antwort entsprechend langsamer.
Hardwarebedarf für eure Aufgaben ermitteln
Schreib uns, welche Modelle ihr einsetzen wollt und wie viele Leute damit arbeiten.