GeForce RTX 5090
NVIDIA · Blackwell · 32 GB · 1.792 GB/s
Die erste Consumer-Karte, bei der die Bandbreite in Rechenzentrumsnähe kommt. 32 GB sind acht mehr als bei der Vorgängergeneration, was den Unterschied zwischen 32B in 4 Bit knapp und 32B in 4 Bit komfortabel ausmacht. Für MoE-Modelle mit RAM-Auslagerung derzeit die stärkste Einzelkarte unter den bezahlbaren.
Technische Daten
| Grafikspeicher | 32 GB GDDR7 |
|---|---|
| Speicherbandbreite | 1.792 GB/s |
| Leistungsaufnahme | 575 W |
| Architektur | Blackwell |
| Marktstart | 2025 Q1 |
Welche Modelle laufen auf der GeForce RTX 5090?
Geschätzter Speicherbedarf offener Sprachmodelle in 16 Bit (BF16), 8 Bit (FP8) und 4 Bit (INT4), gemessen an 32 GB je Karte. Gezeigt werden die 12 größten Modelle, die noch passen — und was sie dabei an Geschwindigkeit liefern.
| Modell | Parameter | 16-Bit | 8-Bit | 4-Bit |
|---|---|---|---|---|
| DeepSeek V4 Flash DeepSeek | 304,2 Mrd. 13,0 Mrd. aktiv | nicht veröffentlicht | nicht veröffentlicht | 152 GB 6× · 40 GB frei >207 tok/s |
| Qwen3 235B-A22B Alibaba | 235,1 Mrd. 22,0 Mrd. aktiv | zu groß | zu groß | 118 GB 5× · 42 GB frei ~122 tok/s |
| MiniMax M2.7 MiniMax | 228,7 Mrd. 10,0 Mrd. aktiv | nicht veröffentlicht | 229 GB 8× · 27 GB frei ~134 tok/s | 114 GB 4× · 14 GB frei >269 tok/s |
| Mistral Large 2411 Mistral AI | 122,6 Mrd. | zu groß | 123 GB 5× · 37 GB frei ~11,0 tok/s | 61 GB 3× · 35 GB frei ~21,9 tok/s |
| gpt-oss-120b OpenAI | 116,8 Mrd. 5,1 Mrd. aktiv | zu groß | 117 GB 5× · 43 GB frei >264 tok/s | 58 GB 3× · 38 GB frei >527 tok/s |
| Qwen3-Next 80B-A3B Alibaba | 81,3 Mrd. 3,0 Mrd. aktiv | 163 GB 6× · 29 GB frei >224 tok/s | 81 GB 3× · 15 GB frei >448 tok/s | 41 GB 2× · 23 GB frei >896 tok/s |
| Llama 3.1 70B Meta | 70,6 Mrd. | 141 GB 5× · 19 GB frei ~9,5 tok/s | 71 GB 3× · 25 GB frei ~19,0 tok/s | 35 GB 2× · 29 GB frei ~38,1 tok/s |
| Hermes 4.3 36B Nous Research | 36,2 Mrd. | 72 GB 3× · 24 GB frei ~18,6 tok/s | 36 GB 2× · 28 GB frei ~37,1 tok/s | 18 GB 1× · 14 GB frei ~74,3 tok/s |
| Qwen3 32B Alibaba | 32,8 Mrd. | 66 GB 3× · 30 GB frei ~20,5 tok/s | 33 GB 2× · 31 GB frei ~41,0 tok/s | 16 GB 1× · 16 GB frei ~82,0 tok/s |
| Gemma 4 31B Google | 31,3 Mrd. | 63 GB 3× · 33 GB frei ~21,5 tok/s | 31 GB 2× · 33 GB frei ~42,9 tok/s | 16 GB 1× · 16 GB frei ~85,9 tok/s |
| Gemma 3 27B Google | 27,4 Mrd. | 55 GB 2× · 9 GB frei ~24,5 tok/s | 27 GB 1× · 5 GB frei ~49,1 tok/s | 14 GB 1× · 18 GB frei ~98,1 tok/s |
| gpt-oss-20b OpenAI | 21,5 Mrd. 3,6 Mrd. aktiv | 43 GB 2× · 21 GB frei ~187 tok/s | 22 GB 1× · 11 GB frei >373 tok/s | 11 GB 1× · 21 GB frei >747 tok/s |
Näherung, keine Messung. Parameterzahlen stammen aus den Safetensors-Metadaten der jeweiligen
HuggingFace-Repositories, nicht aus gerundeten Angaben der Modellkarten. „nicht veröffentlicht"
heißt, dass es diese Präzision als offizielles Release nicht gibt — DeepSeek V4 etwa liefert die
Experten ab Werk in vier Bit aus, eine BF16-Fassung existiert nicht.
Für die Kartenzahl werden 90 % des Speichers als nutzbar
angesetzt; der Rest deckt KV-Cache, Aktivierungen und Treiberkontext ab. Real gemessene
GGUF-Dateien liegen wegen der Blockskalen etwas über den hier gerechneten Größen.
Die Tokenrate ist eine Obergrenze aus Bandbreite ÷ (aktive Parameter × Bytes je Gewicht) bei
75 % Bandbreiteneffizienz. Ab etwa 200 Tokens
pro Sekunde ist die Bandbreite im Einzelbetrieb nicht mehr der bindende Engpass — solche Werte
sind als Durchsatzreserve für parallele Anfragen zu lesen, nicht als Antworttempo für einen
einzelnen Nutzer. Deshalb stehen sie mit „>“ statt „~“.
Die vollständige Herleitung steht unter große Modelle lokal betreiben.
Ähnliche Karten
- GeForce RTX 3090 24 GB · 936 GB/s
- GeForce RTX 4090 24 GB · 1.008 GB/s
- Radeon RX 7900 XTX 24 GB · 960 GB/s
Häufige Fragen
- Wie viel VRAM hat die GeForce RTX 5090?
- 32 GB GDDR7 bei 1.792 GB/s Speicherbandbreite. Der Speicher ist fest auf der Karte und lässt sich nicht erweitern.
- Welches ist das größte Modell, das auf eine einzelne GeForce RTX 5090 passt?
- Hermes 4.3 36B mit 36,2 Milliarden Parametern passt in der kleinsten sinnvollen Quantisierung noch auf eine Karte. Größere Modelle brauchen mehrere Karten oder Auslagerung in den Arbeitsspeicher.
- Wie werden die Tokens pro Sekunde hier berechnet?
- Aus der Speicherbandbreite geteilt durch die Datenmenge, die pro Token gelesen werden muss. Diese Datenmenge sind die aktiven Parameter mal den Bytes je Gewicht. Angesetzt werden 75 Prozent der theoretischen Spitzenbandbreite. Das Ergebnis ist eine Obergrenze, kein Messwert.
- Zählen bei mehreren Karten die Speicher zusammen?
- Für die Frage, ob ein Modell hineinpasst, ja: Die Gewichte lassen sich über mehrere Karten verteilen. Für die Geschwindigkeit gilt das nur eingeschränkt, weil die Kommunikation zwischen den Karten Zeit kostet. Die Werte in der Tabelle sind deshalb bei Mehrkarten-Aufbauten optimistischer als die Praxis.
Ob ein Modell in deinen Arbeitsspeicher passt, rechnet der Hardware-Rechner aus. Wie schnell es dort wäre, der Geschwindigkeits-Rechner unter große Modelle lokal betreiben. Und welcher Weg für dein Budget der richtige ist, steht im Hardware-Guide. Zurück zur Übersicht aller Karten.