GPU-Katalog für lokale Sprachmodelle
Bei lokaler Inferenz entscheiden zwei Zahlen, und Rechenleistung ist keine davon. Der Speicher bestimmt, ob ein Modell überhaupt läuft. Die Bandbreite bestimmt, wie schnell. Deshalb steht in diesem Katalog keine TFLOPS-Spalte — sie würde genau die Verwechslung befeuern, die die meisten Fehlkäufe verursacht.
18 Karten und Chips, nach Speicher sortiert. Jede Detailseite zeigt, welche offenen Modelle in 16, 8 und 4 Bit daraufpassen, wie viele Karten sie brauchen und welche Tokenrate dabei realistisch ist.
| Karte | Speicher | Bandbreite | Verbrauch | Größtes Modell auf einer Karte |
|---|---|---|---|---|
| Instinct MI355X AMD · CDNA 4 | 288 GB | 8.000 GB/s | 1400 W | DeepSeek V4 Flash (304,2 Mrd.) |
| Apple M3 Ultra (256 GB) Apple · Apple Silicon | 256 GB unified | 819 GB/s | 150 W | DeepSeek V4 Flash (304,2 Mrd.) |
| B200 NVIDIA · Blackwell | 192 GB | 8.000 GB/s | 1000 W | DeepSeek V4 Flash (304,2 Mrd.) |
| Instinct MI300X AMD · CDNA 3 | 192 GB | 5.300 GB/s | 750 W | DeepSeek V4 Flash (304,2 Mrd.) |
| H200 SXM NVIDIA · Hopper | 141 GB | 4.800 GB/s | 700 W | Qwen3 235B-A22B (235,1 Mrd.) |
| Apple M4 Max (128 GB) Apple · Apple Silicon | 128 GB unified | 546 GB/s | 90 W | MiniMax M2.7 (228,7 Mrd.) |
| NVIDIA DGX Spark NVIDIA · Grace Blackwell | 128 GB unified | 273 GB/s | 170 W | MiniMax M2.7 (228,7 Mrd.) |
| RTX PRO 6000 Blackwell NVIDIA · Blackwell | 96 GB | 1.792 GB/s | 600 W | Mistral Large 2411 (122,6 Mrd.) |
| H100 SXM NVIDIA · Hopper | 80 GB | 3.350 GB/s | 700 W | Mistral Large 2411 (122,6 Mrd.) |
| A100 80 GB SXM NVIDIA · Ampere | 80 GB | 2.039 GB/s | 400 W | Mistral Large 2411 (122,6 Mrd.) |
| Apple M4 Pro (64 GB) Apple · Apple Silicon | 64 GB unified | 273 GB/s | 50 W | Qwen3-Next 80B-A3B (81,3 Mrd.) |
| RTX 6000 Ada Generation NVIDIA · Ada Lovelace | 48 GB | 960 GB/s | 300 W | Qwen3-Next 80B-A3B (81,3 Mrd.) |
| L40S NVIDIA · Ada Lovelace | 48 GB | 864 GB/s | 350 W | Qwen3-Next 80B-A3B (81,3 Mrd.) |
| GeForce RTX 5090 NVIDIA · Blackwell | 32 GB | 1.792 GB/s | 575 W | Hermes 4.3 36B (36,2 Mrd.) |
| GeForce RTX 4090 NVIDIA · Ada Lovelace | 24 GB | 1.008 GB/s | 450 W | Hermes 4.3 36B (36,2 Mrd.) |
| Radeon RX 7900 XTX AMD · RDNA 3 | 24 GB | 960 GB/s | 355 W | Hermes 4.3 36B (36,2 Mrd.) |
| GeForce RTX 3090 NVIDIA · Ampere | 24 GB | 936 GB/s | 350 W | Hermes 4.3 36B (36,2 Mrd.) |
| GeForce RTX 4060 Ti 16 GB NVIDIA · Ada Lovelace | 16 GB | 288 GB/s | 165 W | Gemma 3 27B (27,4 Mrd.) |
Speicher- und Bandbreitenangaben aus den Herstellerdatenblättern. „Größtes Modell auf einer Karte" meint die kleinste sinnvolle Quantisierung des jeweiligen Modells, ohne KV-Cache. Bei Apple-Chips ist der angegebene Wert der maximal konfigurierbare Unified Memory, den sich Prozessor und Grafikeinheit teilen.
Wie man diese Tabelle liest
Die naheliegende Lesart lautet: mehr Speicher ist besser. Sie stimmt, solange das Modell nicht hineinpasst — und wird falsch, sobald es hineinpasst. Ab da entscheidet allein die Bandbreite. Ein Apple M3 Ultra mit 256 GB hält Modelle, an denen eine RTX 5090 scheitert, liefert aber bei allem, was auf die 5090 passt, weniger als die Hälfte des Tempos.
Die zweite Falle sind Mixture-of-Experts-Modelle. Sie belegen Speicher nach ihrer Gesamtgröße, rechnen aber nur mit einem Bruchteil davon. DeepSeek V4 Flash braucht 152 GB Platz und liest dabei pro Token nur die Datenmenge eines 13-Milliarden-Modells. Genau deshalb lassen sich solche Modelle auf Hardware betreiben, die für ihre Größe eigentlich nicht ausreicht — nachzulesen unter große Modelle lokal betreiben.
Für die Kaufentscheidung selbst ist der Hardware-Guide der bessere Einstieg als diese Tabelle: Er geht von Budget und Anwendungsfall aus statt von der Karte. Und ob ein bestimmtes Modell in deinen vorhandenen Speicher passt, beantwortet der Hardware-Rechner in dreißig Sekunden.