Zum Inhalt springen
LLMlokal

Instinct MI355X

AMD · CDNA 4 · 288 GB · 8.000 GB/s

Mit 288 GB die speicherstärkste Einzelkarte am Markt. Bei sehr großen Modellen schlägt sie vergleichbare Nvidia-Aufbauten nicht durch rohe Rechenleistung, sondern weil das Modell auf weniger Karten passt. Der Verbrauch von 1.400 Watt setzt allerdings Rechenzentrumskühlung voraus.

Technische Daten

Grafikspeicher 288 GB HBM3e
Speicherbandbreite 8.000 GB/s
Leistungsaufnahme 1400 W
Architektur CDNA 4
Marktstart 2025 Q2

Welche Modelle laufen auf der Instinct MI355X?

Geschätzter Speicherbedarf offener Sprachmodelle in 16 Bit (BF16), 8 Bit (FP8) und 4 Bit (INT4), gemessen an 288 GB je Karte. Gezeigt werden die 12 größten Modelle, die noch passen — und was sie dabei an Geschwindigkeit liefern.

Modell Parameter 16-Bit8-Bit4-Bit
DeepSeek V4 Pro DeepSeek 1598,8 Mrd. 49,0 Mrd. aktiv nicht veröffentlicht nicht veröffentlicht 799 GB 4× · 353 GB frei >245 tok/s
Kimi K2 Thinking Moonshot AI 1058,1 Mrd. 32,0 Mrd. aktiv zu groß 1.058 GB 5× · 382 GB frei ~188 tok/s 529 GB 3× · 335 GB frei >375 tok/s
DeepSeek V3.2 DeepSeek 685,4 Mrd. 37,0 Mrd. aktiv nicht veröffentlicht 685 GB 3× · 179 GB frei ~162 tok/s 343 GB 2× · 233 GB frei >324 tok/s
DeepSeek R1 DeepSeek 684,5 Mrd. 37,0 Mrd. aktiv nicht veröffentlicht 685 GB 3× · 180 GB frei ~162 tok/s 342 GB 2× · 234 GB frei >324 tok/s
DeepSeek V4 Flash DeepSeek 304,2 Mrd. 13,0 Mrd. aktiv nicht veröffentlicht nicht veröffentlicht 152 GB 1× · 136 GB frei >923 tok/s
Qwen3 235B-A22B Alibaba 235,1 Mrd. 22,0 Mrd. aktiv 470 GB 2× · 106 GB frei ~136 tok/s 235 GB 1× · 53 GB frei >273 tok/s 118 GB 1× · 170 GB frei >545 tok/s
MiniMax M2.7 MiniMax 228,7 Mrd. 10,0 Mrd. aktiv nicht veröffentlicht 229 GB 1× · 59 GB frei >600 tok/s 114 GB 1× · 174 GB frei >1.200 tok/s
Mistral Large 2411 Mistral AI 122,6 Mrd. 245 GB 1× · 43 GB frei ~24,5 tok/s 123 GB 1× · 165 GB frei ~48,9 tok/s 61 GB 1× · 227 GB frei ~97,9 tok/s
gpt-oss-120b OpenAI 116,8 Mrd. 5,1 Mrd. aktiv 234 GB 1× · 54 GB frei >588 tok/s 117 GB 1× · 171 GB frei >1.176 tok/s 58 GB 1× · 230 GB frei >2.353 tok/s
Qwen3-Next 80B-A3B Alibaba 81,3 Mrd. 3,0 Mrd. aktiv 163 GB 1× · 125 GB frei >1.000 tok/s 81 GB 1× · 207 GB frei >2.000 tok/s 41 GB 1× · 247 GB frei >4.000 tok/s
Llama 3.1 70B Meta 70,6 Mrd. 141 GB 1× · 147 GB frei ~42,5 tok/s 71 GB 1× · 217 GB frei ~85,0 tok/s 35 GB 1× · 253 GB frei ~170 tok/s
Hermes 4.3 36B Nous Research 36,2 Mrd. 72 GB 1× · 216 GB frei ~82,9 tok/s 36 GB 1× · 252 GB frei ~166 tok/s 18 GB 1× · 270 GB frei >331 tok/s

Näherung, keine Messung. Parameterzahlen stammen aus den Safetensors-Metadaten der jeweiligen HuggingFace-Repositories, nicht aus gerundeten Angaben der Modellkarten. „nicht veröffentlicht" heißt, dass es diese Präzision als offizielles Release nicht gibt — DeepSeek V4 etwa liefert die Experten ab Werk in vier Bit aus, eine BF16-Fassung existiert nicht.

Für die Kartenzahl werden 90 % des Speichers als nutzbar angesetzt; der Rest deckt KV-Cache, Aktivierungen und Treiberkontext ab. Real gemessene GGUF-Dateien liegen wegen der Blockskalen etwas über den hier gerechneten Größen.

Die Tokenrate ist eine Obergrenze aus Bandbreite ÷ (aktive Parameter × Bytes je Gewicht) bei 75 % Bandbreiteneffizienz. Ab etwa 200 Tokens pro Sekunde ist die Bandbreite im Einzelbetrieb nicht mehr der bindende Engpass — solche Werte sind als Durchsatzreserve für parallele Anfragen zu lesen, nicht als Antworttempo für einen einzelnen Nutzer. Deshalb stehen sie mit „>“ statt „~“. Die vollständige Herleitung steht unter große Modelle lokal betreiben.

Ähnliche Karten

Häufige Fragen

Wie viel VRAM hat die Instinct MI355X?
288 GB HBM3e bei 8.000 GB/s Speicherbandbreite. Der Speicher ist fest auf der Karte und lässt sich nicht erweitern.
Welches ist das größte Modell, das auf eine einzelne Instinct MI355X passt?
DeepSeek V4 Flash mit 304,2 Milliarden Parametern passt in der kleinsten sinnvollen Quantisierung noch auf eine Karte. Größere Modelle brauchen mehrere Karten oder Auslagerung in den Arbeitsspeicher.
Wie werden die Tokens pro Sekunde hier berechnet?
Aus der Speicherbandbreite geteilt durch die Datenmenge, die pro Token gelesen werden muss. Diese Datenmenge sind die aktiven Parameter mal den Bytes je Gewicht. Angesetzt werden 75 Prozent der theoretischen Spitzenbandbreite. Das Ergebnis ist eine Obergrenze, kein Messwert.
Zählen bei mehreren Karten die Speicher zusammen?
Für die Frage, ob ein Modell hineinpasst, ja: Die Gewichte lassen sich über mehrere Karten verteilen. Für die Geschwindigkeit gilt das nur eingeschränkt, weil die Kommunikation zwischen den Karten Zeit kostet. Die Werte in der Tabelle sind deshalb bei Mehrkarten-Aufbauten optimistischer als die Praxis.

Ob ein Modell in deinen Arbeitsspeicher passt, rechnet der Hardware-Rechner aus. Wie schnell es dort wäre, der Geschwindigkeits-Rechner unter große Modelle lokal betreiben. Und welcher Weg für dein Budget der richtige ist, steht im Hardware-Guide. Zurück zur Übersicht aller Karten.

Beratung