Zum Inhalt springen
LLMlokal

GeForce RTX 4060 Ti 16 GB

NVIDIA · Ada Lovelace · 16 GB · 288 GB/s

Der günstigste Weg zu 16 GB Grafikspeicher, und für Spiele eine schwache Karte — was hier egal ist. Die Bandbreite von 288 GB/s ist der Haken: Modelle passen hinein, laufen aber deutlich langsamer als die Kapazität vermuten lässt. Als Einstieg tragfähig, als Dauerlösung selten.

Technische Daten

Grafikspeicher 16 GB GDDR6
Speicherbandbreite 288 GB/s
Leistungsaufnahme 165 W
Architektur Ada Lovelace
Marktstart 2023 Q3

Welche Modelle laufen auf der GeForce RTX 4060 Ti 16 GB?

Geschätzter Speicherbedarf offener Sprachmodelle in 16 Bit (BF16), 8 Bit (FP8) und 4 Bit (INT4), gemessen an 16 GB je Karte. Gezeigt werden die 12 größten Modelle, die noch passen — und was sie dabei an Geschwindigkeit liefern.

Modell Parameter 16-Bit8-Bit4-Bit
MiniMax M2.7 MiniMax 228,7 Mrd. 10,0 Mrd. aktiv nicht veröffentlicht zu groß 114 GB 8× · 14 GB frei ~43,2 tok/s
Mistral Large 2411 Mistral AI 122,6 Mrd. zu groß zu groß 61 GB 5× · 19 GB frei ~3,5 tok/s
gpt-oss-120b OpenAI 116,8 Mrd. 5,1 Mrd. aktiv zu groß zu groß 58 GB 5× · 22 GB frei ~84,7 tok/s
Qwen3-Next 80B-A3B Alibaba 81,3 Mrd. 3,0 Mrd. aktiv zu groß 81 GB 6× · 15 GB frei ~72,0 tok/s 41 GB 3× · 7 GB frei ~144 tok/s
Llama 3.1 70B Meta 70,6 Mrd. zu groß 71 GB 5× · 9 GB frei ~3,1 tok/s 35 GB 3× · 13 GB frei ~6,1 tok/s
Hermes 4.3 36B Nous Research 36,2 Mrd. 72 GB 6× · 24 GB frei ~3,0 tok/s 36 GB 3× · 12 GB frei ~6,0 tok/s 18 GB 2× · 14 GB frei ~11,9 tok/s
Qwen3 32B Alibaba 32,8 Mrd. 66 GB 5× · 14 GB frei ~3,3 tok/s 33 GB 3× · 15 GB frei ~6,6 tok/s 16 GB 2× · 16 GB frei ~13,2 tok/s
Gemma 4 31B Google 31,3 Mrd. 63 GB 5× · 17 GB frei ~3,5 tok/s 31 GB 3× · 17 GB frei ~6,9 tok/s 16 GB 2× · 16 GB frei ~13,8 tok/s
Gemma 3 27B Google 27,4 Mrd. 55 GB 4× · 9 GB frei ~3,9 tok/s 27 GB 2× · 5 GB frei ~7,9 tok/s 14 GB 1× · 2 GB frei ~15,8 tok/s
gpt-oss-20b OpenAI 21,5 Mrd. 3,6 Mrd. aktiv 43 GB 3× · 5 GB frei ~30,0 tok/s 22 GB 2× · 11 GB frei ~60,0 tok/s 11 GB 1× · 5 GB frei ~120 tok/s
Qwen3 8B Alibaba 8,2 Mrd. 16 GB 2× · 16 GB frei ~13,2 tok/s 8 GB 1× · 8 GB frei ~26,3 tok/s 4 GB 1× · 12 GB frei ~52,7 tok/s
Llama 3.1 8B Meta 8,0 Mrd. 16 GB 2× · 16 GB frei ~13,5 tok/s 8 GB 1× · 8 GB frei ~27,0 tok/s 4 GB 1× · 12 GB frei ~54,0 tok/s

Näherung, keine Messung. Parameterzahlen stammen aus den Safetensors-Metadaten der jeweiligen HuggingFace-Repositories, nicht aus gerundeten Angaben der Modellkarten. „nicht veröffentlicht" heißt, dass es diese Präzision als offizielles Release nicht gibt — DeepSeek V4 etwa liefert die Experten ab Werk in vier Bit aus, eine BF16-Fassung existiert nicht.

Für die Kartenzahl werden 90 % des Speichers als nutzbar angesetzt; der Rest deckt KV-Cache, Aktivierungen und Treiberkontext ab. Real gemessene GGUF-Dateien liegen wegen der Blockskalen etwas über den hier gerechneten Größen.

Die Tokenrate ist eine Obergrenze aus Bandbreite ÷ (aktive Parameter × Bytes je Gewicht) bei 75 % Bandbreiteneffizienz. Ab etwa 200 Tokens pro Sekunde ist die Bandbreite im Einzelbetrieb nicht mehr der bindende Engpass — solche Werte sind als Durchsatzreserve für parallele Anfragen zu lesen, nicht als Antworttempo für einen einzelnen Nutzer. Deshalb stehen sie mit „>“ statt „~“. Die vollständige Herleitung steht unter große Modelle lokal betreiben.

Ähnliche Karten

Häufige Fragen

Wie viel VRAM hat die GeForce RTX 4060 Ti 16 GB?
16 GB GDDR6 bei 288 GB/s Speicherbandbreite. Der Speicher ist fest auf der Karte und lässt sich nicht erweitern.
Welches ist das größte Modell, das auf eine einzelne GeForce RTX 4060 Ti 16 GB passt?
Gemma 3 27B mit 27,4 Milliarden Parametern passt in der kleinsten sinnvollen Quantisierung noch auf eine Karte. Größere Modelle brauchen mehrere Karten oder Auslagerung in den Arbeitsspeicher.
Wie werden die Tokens pro Sekunde hier berechnet?
Aus der Speicherbandbreite geteilt durch die Datenmenge, die pro Token gelesen werden muss. Diese Datenmenge sind die aktiven Parameter mal den Bytes je Gewicht. Angesetzt werden 75 Prozent der theoretischen Spitzenbandbreite. Das Ergebnis ist eine Obergrenze, kein Messwert.
Zählen bei mehreren Karten die Speicher zusammen?
Für die Frage, ob ein Modell hineinpasst, ja: Die Gewichte lassen sich über mehrere Karten verteilen. Für die Geschwindigkeit gilt das nur eingeschränkt, weil die Kommunikation zwischen den Karten Zeit kostet. Die Werte in der Tabelle sind deshalb bei Mehrkarten-Aufbauten optimistischer als die Praxis.

Ob ein Modell in deinen Arbeitsspeicher passt, rechnet der Hardware-Rechner aus. Wie schnell es dort wäre, der Geschwindigkeits-Rechner unter große Modelle lokal betreiben. Und welcher Weg für dein Budget der richtige ist, steht im Hardware-Guide. Zurück zur Übersicht aller Karten.

Beratung