Apple M3 Ultra (256 GB)
Apple · Apple Silicon · 256 GB · 819 GB/s
Lange die einzige bezahlbare Maschine, auf der Privatpersonen sehr große Modelle vollständig im Speicher halten konnten. Die 512-GB-Option wurde 2026 gestrichen und das 256-GB-Upgrade deutlich verteuert — Folge der angespannten Lage am Speichermarkt. Wer eine gebrauchte Vollausstattung findet, bekommt nach wie vor viel Speicher pro Watt.
Technische Daten
| Unified Memory | 256 GB LPDDR5 Unified |
|---|---|
| Speicherbandbreite | 819 GB/s |
| Leistungsaufnahme | 150 W |
| Architektur | Apple Silicon |
| Marktstart | 2025 Q1 |
Welche Modelle laufen auf der Apple M3 Ultra (256 GB)?
Geschätzter Speicherbedarf offener Sprachmodelle in 16 Bit (BF16), 8 Bit (FP8) und 4 Bit (INT4), gemessen an 256 GB je Karte. Gezeigt werden die 12 größten Modelle, die noch passen — und was sie dabei an Geschwindigkeit liefern.
| Modell | Parameter | 16-Bit | 8-Bit | 4-Bit |
|---|---|---|---|---|
| DeepSeek V4 Pro DeepSeek | 1598,8 Mrd. 49,0 Mrd. aktiv | nicht veröffentlicht | nicht veröffentlicht | 799 GB 4× · 225 GB frei ~25,1 tok/s |
| Kimi K2 Thinking Moonshot AI | 1058,1 Mrd. 32,0 Mrd. aktiv | zu groß | 1.058 GB 5× · 222 GB frei ~19,2 tok/s | 529 GB 3× · 239 GB frei ~38,4 tok/s |
| DeepSeek V3.2 DeepSeek | 685,4 Mrd. 37,0 Mrd. aktiv | nicht veröffentlicht | 685 GB 3× · 83 GB frei ~16,6 tok/s | 343 GB 2× · 169 GB frei ~33,2 tok/s |
| DeepSeek R1 DeepSeek | 684,5 Mrd. 37,0 Mrd. aktiv | nicht veröffentlicht | 685 GB 3× · 84 GB frei ~16,6 tok/s | 342 GB 2× · 170 GB frei ~33,2 tok/s |
| DeepSeek V4 Flash DeepSeek | 304,2 Mrd. 13,0 Mrd. aktiv | nicht veröffentlicht | nicht veröffentlicht | 152 GB 1× · 104 GB frei ~94,5 tok/s |
| Qwen3 235B-A22B Alibaba | 235,1 Mrd. 22,0 Mrd. aktiv | 470 GB 3× · 298 GB frei ~14,0 tok/s | 235 GB 2× · 277 GB frei ~27,9 tok/s | 118 GB 1× · 138 GB frei ~55,8 tok/s |
| MiniMax M2.7 MiniMax | 228,7 Mrd. 10,0 Mrd. aktiv | nicht veröffentlicht | 229 GB 1× · 27 GB frei ~61,4 tok/s | 114 GB 1× · 142 GB frei ~123 tok/s |
| Mistral Large 2411 Mistral AI | 122,6 Mrd. | 245 GB 2× · 267 GB frei ~2,5 tok/s | 123 GB 1× · 133 GB frei ~5,0 tok/s | 61 GB 1× · 195 GB frei ~10,0 tok/s |
| gpt-oss-120b OpenAI | 116,8 Mrd. 5,1 Mrd. aktiv | 234 GB 2× · 278 GB frei ~60,2 tok/s | 117 GB 1× · 139 GB frei ~120 tok/s | 58 GB 1× · 198 GB frei >241 tok/s |
| Qwen3-Next 80B-A3B Alibaba | 81,3 Mrd. 3,0 Mrd. aktiv | 163 GB 1× · 93 GB frei ~102 tok/s | 81 GB 1× · 175 GB frei >205 tok/s | 41 GB 1× · 215 GB frei >410 tok/s |
| Llama 3.1 70B Meta | 70,6 Mrd. | 141 GB 1× · 115 GB frei ~4,4 tok/s | 71 GB 1× · 185 GB frei ~8,7 tok/s | 35 GB 1× · 221 GB frei ~17,4 tok/s |
| Hermes 4.3 36B Nous Research | 36,2 Mrd. | 72 GB 1× · 184 GB frei ~8,5 tok/s | 36 GB 1× · 220 GB frei ~17,0 tok/s | 18 GB 1× · 238 GB frei ~33,9 tok/s |
Näherung, keine Messung. Parameterzahlen stammen aus den Safetensors-Metadaten der jeweiligen
HuggingFace-Repositories, nicht aus gerundeten Angaben der Modellkarten. „nicht veröffentlicht"
heißt, dass es diese Präzision als offizielles Release nicht gibt — DeepSeek V4 etwa liefert die
Experten ab Werk in vier Bit aus, eine BF16-Fassung existiert nicht.
Für die Kartenzahl werden 90 % des Speichers als nutzbar
angesetzt; der Rest deckt KV-Cache, Aktivierungen und Treiberkontext ab. Real gemessene
GGUF-Dateien liegen wegen der Blockskalen etwas über den hier gerechneten Größen.
Die Tokenrate ist eine Obergrenze aus Bandbreite ÷ (aktive Parameter × Bytes je Gewicht) bei
75 % Bandbreiteneffizienz. Ab etwa 200 Tokens
pro Sekunde ist die Bandbreite im Einzelbetrieb nicht mehr der bindende Engpass — solche Werte
sind als Durchsatzreserve für parallele Anfragen zu lesen, nicht als Antworttempo für einen
einzelnen Nutzer. Deshalb stehen sie mit „>“ statt „~“.
Die vollständige Herleitung steht unter große Modelle lokal betreiben.
Ähnliche Karten
- Instinct MI355X 288 GB · 8.000 GB/s
- B200 192 GB · 8.000 GB/s
- Instinct MI300X 192 GB · 5.300 GB/s
Häufige Fragen
- Wie viel VRAM hat die Apple M3 Ultra (256 GB)?
- 256 GB LPDDR5 Unified bei 819 GB/s Speicherbandbreite. Es handelt sich um gemeinsamen Speicher für Prozessor und Grafikeinheit, eine getrennte VRAM-Angabe gibt es deshalb nicht.
- Welches ist das größte Modell, das auf eine einzelne Apple M3 Ultra (256 GB) passt?
- DeepSeek V4 Flash mit 304,2 Milliarden Parametern passt in der kleinsten sinnvollen Quantisierung noch auf eine Karte. Größere Modelle brauchen mehrere Karten oder Auslagerung in den Arbeitsspeicher.
- Wie werden die Tokens pro Sekunde hier berechnet?
- Aus der Speicherbandbreite geteilt durch die Datenmenge, die pro Token gelesen werden muss. Diese Datenmenge sind die aktiven Parameter mal den Bytes je Gewicht. Angesetzt werden 75 Prozent der theoretischen Spitzenbandbreite. Das Ergebnis ist eine Obergrenze, kein Messwert.
- Zählen bei mehreren Karten die Speicher zusammen?
- Für die Frage, ob ein Modell hineinpasst, ja: Die Gewichte lassen sich über mehrere Karten verteilen. Für die Geschwindigkeit gilt das nur eingeschränkt, weil die Kommunikation zwischen den Karten Zeit kostet. Die Werte in der Tabelle sind deshalb bei Mehrkarten-Aufbauten optimistischer als die Praxis.
Ob ein Modell in deinen Arbeitsspeicher passt, rechnet der Hardware-Rechner aus. Wie schnell es dort wäre, der Geschwindigkeits-Rechner unter große Modelle lokal betreiben. Und welcher Weg für dein Budget der richtige ist, steht im Hardware-Guide. Zurück zur Übersicht aller Karten.