DGX Spark vs Strix Halo vs Gorgon Halo: Welche Hardware für lokale KI passt zu Ihnen?
DGX Spark vs Strix Halo vs Gorgon Halo: Welche Plattform passt zu Ihrem lokalen LLM-Szenario?
Ein System mit 192GB ist nicht automatisch schneller als eines mit 128GB. Eine Spezifikation von 1 PFLOP sagt nicht, wie schnell ein LLM Token erzeugt. Und ein Benchmark ohne getrennte Prefill- und Decode-Werte kann ein verzerrtes Bild der realen Arbeitsgeschwindigkeit zeichnen.
Diese Unterschiede zählen, wenn Sie die NVIDIA-Plattform, die AMD-Option mit 128GB und neuere Konfigurationen der 192GB-Klasse für lokale KI / lokale LLMs vergleichen.

Alle drei können Anwendungen abdecken, die früher zu großen Towern mit diskreter GPU gedrängt haben: private Inferenz, Coding-Agenten, RAG, langer Kontext und Multi-Modell-Pipelines. Sie lösen diese Probleme nur auf unterschiedliche Weise.
Vergleichen Sie sinnvoll so:
- Passen Modell und Arbeitsdaten in den Speicher?
- Wie schnell verarbeitet das System einen langen Prompt (Prefill)?
- Wie schnell erzeugt es Tokens (Decode)?
- Hängt Ihre Software von CUDA ab?
- Was passiert, wenn Ihr Szenario über 128GB hinauswächst?
Die wichtigste Unterscheidung bleibt:
Die Speicherkapazität bestimmt, was hineinpasst. Speicherbandbreite, Rechenleistung, Quantisierung und Software bestimmen, wie schnell es läuft.
Zentrale Frage dieser Anleitung: Wie wählen Sie zwischen dem NVIDIA-Gerät mit 128GB, der AMD-Strix-Option mit 128GB und Systemen der Gorgon-Kurzbezeichnung in der 192GB-Klasse für lokale LLM-Inferenz – besonders die Kapazitätsgabel 128GB vs 192GB – ohne einen einzelnen Tokens/s-Screenshot als Ranking zu behandeln.
Schnellvergleich
| Merkmal | DGX Spark | Strix Halo | Gorgon Halo |
|---|---|---|---|
| Hauptplattform | NVIDIA Grace Blackwell (NVIDIA Blackwell) | AMD Zen 5 + Radeon-APU | AMD-Deskside-Klasse mit mehr Speicher |
| Unified Memory | 128GB | Bis 128GB in Flaggschiff-Systemen | Bis 192GB (Konfigurationen der Max+-PRO-495-Klasse) |
| Speicherbandbreite | 273 GB/s angegeben | 256 GB/s (LPDDR5X-8000, AMD-Peak) | 273 GB/s theoretischer Peak (256-Bit × LPDDR5X-8533) |
| Software | CUDA / DGX OS | ROCm / Vulkan / llama.cpp / Ollama | ROCm / Vulkan / llama.cpp / Ollama |
| Bauform | Kompaktes KI-Gerät | KI-Mini-PC / kompakte Workstation | Kompakte KI-Workstation |
| Bester Kaufgrund | CUDA-orientierte Entwicklung + starkes Prefill in einigen veröffentlichten Tests | Lokale Inferenz mit 128GB plus normaler x86-PC | Anwendungen, die 128GB wirklich überschreiten |
Diese Tabelle ordnet die Plattformen ein. Sie bedeutet nicht, dass eine Spalte universell schneller ist – das hängt vom Szenario ab.
AMD listet Gorgon Halo als früheren Codenamen auf der Seite zum Ryzen AI Max+ PRO 495 (bis 192GB, Radeon 8065S). Hier nutzen wir ihn als Käufer-Kurzform für diese Deskside-Stufe mit 192GB, nicht als eigene Consumer-Architekturmarke.

Kurzplanung: Was 128GB vs 192GB typischerweise bringt
Nur Orientierung zur Planung – keine harte Modellgrenze. Quantisierung, Kontextlänge und Multi-Service-Stacks verschieben die reale Zahl.
| Unified Memory | Praktische Rolle (nur Planung) |
|---|---|
| ~64GB | 7B–32B komfortabel; größere Modelle nur mit aggressiver Quantisierung |
| 128GB | 70B-Klasse komfortabel; manche 120B-/MoE-Szenarien je nach Quantisierung und Kontext |
| 192GB | Höhere Quants, größere MoE-Gewichtsdateien, Multi-Modell-Stacks, mehr KV-Cache-Spielraum |
Wenn 128GB bereits mit Reserve passen, behandeln Sie 192GB als Kapazitätspuffer.

Flaschenhals-Karte für LLM-Hardware
| Anwendung | Erster Flaschenhals | Zweiter Flaschenhals | Warum |
|---|---|---|---|
| 7B-Chat | Rechenleistung / Software | Speicher | Modell ist relativ klein |
| 32B-Chat | Bandbreite | Rechenleistung | Decode wird speicherempfindlicher |
| 70B | Kapazität | Bandbreite | Gewichtsabdruck steigt stark |
| 120B+ | Kapazität | Bandbreite | Einpassen wird zur ersten Grenze |
| Langer Kontext | KV-Cache | Speicher | Kontext erhöht Cache-Bedarf |
| Coding-Agent | Kontext + KV | Decode | Lange Prompts + Generierung |
| RAG | Prefill | Speicherbandbreite | Viele Eingabe-Tokens |
| MoE | Kapazität + Runtime | Bandbreite | Gesamtparameter und aktive Parameter unterscheiden sich |
Diese Karte ist der eigentliche Einkaufsleitfaden für diese Plattformen 2026 – nicht ein einzelner Tokens/s-Screenshot.
Warum genau diese drei Plattformen verglichen werden
Vom AI-PC zur lokalen Workstation
Marketing rund um „AI PC“ stützt sich weiterhin auf NPU-TOPS. Wer ernsthaft lokale LLMs kauft, achtet eher auf Unified Memory, GPU-/APU-Inferenzpfade und darauf, ob die Box private Agenten, RAG und Arbeit mit langem Kontext auf dem Schreibtisch hosten kann – deshalb tauchen NVIDIA DGX Spark, AMD Strix Halo (128GB) und Konfigurationen der 192GB-Klasse gemeinsam auf, wenn nach KI-Mini-PC- bzw. kompakter Workstation-Hardware gesucht wird.
Warum Speicherkapazität zur Schlüssel-Spezifikation wurde
Sobald Gewichte der 70B-Klasse und 120B+ lokal geladen wurden, klangen 128GB und 192GB nicht mehr nach Luxus, sondern nach „Lädt das überhaupt?“. Unified Memory erklärt, warum diese drei Desktop-Optionen zusammen Aufmerksamkeit bekommen: Sie versprechen einen gemeinsamen Pool, der groß genug für lokale LLM-Hardware ist, die früher Multi-GPU-Tower brauchte.
(Chip-Unterschiede 128GB vs. 192GB finden Sie in unserem Vergleich Ryzen AI Max+ 395 vs PRO 495. Auf der AMD-Produktseite listet der Ryzen AI Max+ PRO 495 den früheren Codenamen Gorgon Halo, Radeon 8065S (40 CUs) und max. 192GB LPDDR5X-8533 – das ist das Silizium der 192GB-Klasse, das diese Anleitung auf Deskside-SKUs abbildet.)
Was ist AMD Strix Halo?
Plattform und Ryzen AI Max
Strix Halo ist AMDs High-End-APU-Plattform: eine starke Zen-5-CPU, eine große Radeon-iGPU und ein breiter LPDDR5X-Unified-Memory-Bus in kompakten Systemen. Käufer tippen meist AMD Strix Halo; der Ryzen AI Max+ 395 (häufig auch als Ryzen AI Max 395 gesucht) gehört zu den bekanntesten Chips, die diese Plattform in Strix-Halo-Mini-PC- und Workstation-SKUs umsetzen (einschließlich des Profils Ryzen AI Max+ 395 128GB).
Grundlagen zu Plattform und Bauform finden Sie in unserem Überblick zum Strix-Halo-Mini-PC für lokale KI. Wenn Sie einen Strix-Halo-PC mit Appliance-Systemen vergleichen, starten Sie dort.
Warum Strix für lokale KI interessant ist
Die Plattform zählt für lokale KI, weil sie kombiniert:
- Einen großen Unified-Memory-Pool (häufig bis 128GB in Flaggschiff-Konfigurationen wie Strix Halo 128GB)
- Echte GPU-Rechenleistung für LLM-Inferenz (nicht nur NPU-Marketing)
- Kompakte Gehäuseoptionen – von kompakten AMD-Mini-PC-Designs bis zu dichteren Deskside-Boxen
- Genug Spielraum für alltägliche x86-Software neben dem Modell
Es ist kein „diskreter 4090 im Winzgehäuse“. Es ist ein APU-first-Ansatz: große Gewichte in einem Pool unterbringen, akzeptieren, dass Decode oft speicherbandbreitengebunden ist, und den Software-Pfad optimieren (ROCm, Vulkan, llama.cpp, Ollama).
Was ist AMD Gorgon Halo?
Das ist die Informationslücke, die die meisten Spark-vs-Strix-Beiträge noch übersehen.
Kapazität: 128GB vs AMD der 192-GB-Klasse
AMDs eigene Produktseite listet Gorgon Halo als früheren Codenamen für den Ryzen AI Max+ PRO 495 (Radeon 8065S, 40 CUs, bis 192GB LPDDR5X-8533). In dieser Anleitung bleibt „Gorgon Halo“ vor allem eine Käufer-Kurzform für diese Deskside-Stufe mit 192GB – nicht als eigene Consumer-Architekturmarke, nach der Sie suchen müssten.
Für Käufer ist die nützliche Unterscheidung einfacher:
- AMDs Option der 128GB-Klasse → oft ausreichend für viele dauerhaft im Speicher geladene lokale LLM-Stacks
- die 192GB-Konfiguration → mehr Raum, wenn Gewichte, KV-Cache und Multi-Service-Stacks nicht mehr passen
Gegenüber Strix ist das also vor allem eine Kapazitätsgeschichte (mit konfigurationsabhängigen Takten und Speicheraufteilungen), gezielt auf Anwendungen, die bereits an der 128GB-Wand scheitern – Multi-Service-RAG, längerer Kontext, größere MoE-Gewichtsdateien, höhere Quants.
Gegenüber dem NVIDIA-Gerät mit 128 GB ist die Frage wieder eine andere: Die NVIDIA-Box bleibt auf CUDA und einen kohärenten 128-GB-Pool ausgerichtet; die AMD-Systeme mit mehr Speicher beantworten „Was, wenn 128GB dauerhaft geladener Speicher die echte Wand ist?“
Warum höhere Speicherkapazität für lokale LLMs zählt
Kapazität zeigt sich bei größeren Gewichten, längeren KV-Caches, Multi-Service-Stacks oder weniger aggressiver Quantisierung.
Ist mehr Speicher immer besser?
Nein. Kapazität legt fest, was Sie laden können; die Geschwindigkeit folgt weiterhin Bandbreite, Rechenleistung und Software.

Was ist NVIDIA DGX Spark?
Spezifikationen, die für KI zählen
Laut NVIDIA-Produktseite sind die DGX-Spark-Spezifikationen, die für lokale KI / LLM-Inferenz (und für vorsichtiges Lesen von Leistungsangaben) zählen, in etwa:
- NVIDIA GB10 Grace-Blackwell-Superchip (NVIDIA Blackwell GPU)
- 128GB kohärenter Unified Memory bei angegebenen 273 GB/s
- FP4-Klassen-Tensor-Marketingleistung (bis ~1 PFLOP Sparse FP4 – theoretisch)
- CUDA-Software-Stack, DGX OS, Playbooks / NIM-orientierte Werkzeuge
- Schneller lokaler Speicher (Founders-Konfigurationen mit großem NVMe)
- ConnectX-7-Netzwerk für Multi-Box-Scale-out-Szenarien
Der Listenpreis der Founders Edition liegt derzeit bei 4.699 USD (nur Preisrahmen – diese Anleitung ist keine Preisübersicht).
Warum CUDA zur Spark-Story gehört
Für viele Käufer ist die NVIDIA-Plattform nicht „noch eine 128-GB-Box“. Sie ist der Zugang zum CUDA-Ökosystem: Frameworks, Kernel, Fine-Tune-Rezepte und Serving-Stacks, die bereits NVIDIA voraussetzt. Diese Software-Schicht ist Teil der gemessenen LLM-Leistung, kein Zubehör.
Wichtige Hardware-Unterschiede (Detail)
Der Schnellvergleich oben reicht für die meisten Käufer. Diese Tabelle ergänzt die dichtere Spezifikationsebene.
| Merkmal | Spark | Strix | Gorgon |
|---|---|---|---|
| Architektur | Grace Blackwell (GB10) | Strix-APU-Familie | Max+-PRO-495-Klasse / AMD-Deskside mit mehr Speicher |
| CPU | 20-Kern-Arm | Zen 5 x86 (Strix-Klasse) | Zen 5 x86 (PRO-495-Klasse) |
| GPU | Blackwell GPU | Radeon-iGPU (z. B. Radeon 8060S) | Radeon-iGPU (z. B. 8065S-Klasse) |
| Unified Memory | 128GB | Typisch bis 128GB | Bis 192GB |
| Speicherbandbreite | 273 GB/s angegeben | 256 GB/s (LPDDR5X-8000, AMD-Peak) | 273 GB/s theoretischer Peak (256-Bit × LPDDR5X-8533); OEM-Dauerwerte TBD |
| KI-Rechenleistung (Marketing) | ~1 PFLOP FP4 Sparse | Plattform-TOPS / iGPU | Plattform-TOPS-Labels sind weiterhin ≠ LLM-tok/s |
| Software-Stack | CUDA / DGX OS | ROCm / Vulkan / llama.cpp | ROCm / Vulkan / llama.cpp |
| Bauform | Ultra-kompaktes Gerät | KI-Mini-PC / kompakte Workstation | Kompakte Workstation-SKUs |
| Hauptkaufargument | CUDA-Ökosystem + veröffentlichtes Prefill in einigen Tests | Kompakte AMD-Plattform mit 128GB | Höhere Speicherkapazität für speicherbegrenzte Stacks |
Die Spezifikationen, die für LLMs wirklich zählen
Für LLM-Inferenz sind drei Zahlen nicht austauschbar:
- Speicherkapazität – passen Gewichte + KV + Runtime?
- Speicherbandbreite – wie schnell kann Decode Gewichte bewegen?
- Rechenleistung + Software – wie schnell ist Prefill, und welche Kernel gibt es?
TOPS / PFLOPS allein beantworten diese Fragen nicht.
Speicherkapazität vs Speicherbandbreite für lokale LLMs
Warum 128GB wichtiger sein können als GPU-FLOPS
Passt das Modell nicht, sind FLOPS irrelevant. Deshalb drehen sich Gespräche über lokale LLM-Hardware um Strix Halo 128GB und den 128GB-Pool von Spark – und deshalb ist Gorgon 192GB für kapazitätsgebundene Nutzer eine echte Produktgeschichte.
Warum mehr Speicher nicht automatisch schnellere Inferenz bedeutet
Sobald das Working Set passt, hebt zusätzlicher RAM Tokens/s selten von allein. Decode auf Unified-Memory-APUs ist oft speicherbandbreitengebunden. Extra-Kapazität reduziert vor allem Swapping, Unloading und erzwungenes stärkeres Quantisieren.
Was Speicherbandbreite verändert
Bandbreite zeigt sich am stärksten bei:
- Decode (Token-für-Token-Generierung)
- Gewichtsstroming bei großen dichten Modellen
- speichergebundener LLM-Geschwindigkeit, wenn die GPU auf den Bus wartet
Sparks angegebene 273 GB/s und Strix’ Peak von 256 GB/s helfen zu erklären, warum Generierungslücken in manchen öffentlichen Vergleichsläufen bescheiden wirken – selbst wenn Prefill-Lücken groß aussehen. Konfigurationen der Max+-PRO-495-Klasse mit 192GB landen ebenfalls bei einem theoretischen Peak von 273 GB/s aus 256-Bit × LPDDR5X-8533 (OEM-Dauerwerte können abweichen).
Was passiert, wenn Sie mehr Kontext hinzufügen?
Längerer Kontext wächst den KV-Cache. Coding-Agenten und RAG, die riesige Prompts erneut senden, belasten Prefill und Cache-Abdruck. Das ist eine andere Flaschenhals-Karte als kurze Chatbot-Turns.
Warum Modellgröße allein nicht mehr reicht, um lokale KI-Hardware zu wählen
„Wie viele GB für ein 70B-Modell?“ ist die falsche Standalone-Frage.
Ein praktisches Speicherbudget für lokale LLMs:
- Modellgewichte (abhängig von der Quantisierung)
- KV-Cache (abhängig von der Kontextlänge)
- Runtime-Overhead (Framework, CUDA-/ROCm-Graphs, OS)
- Kontext/Tools (Agent-Scratch, Retrieval-Puffer)
- Mehrere Modelle/Dienste (Embedder, Reranker, zweites LLM)
Dieselbe „70B“-Bezeichnung kann in einem Stack auf 128GB komfortabel und in einem anderen schmerzhaft sein. Kapazitätsplanung ist eine Summe, keine Parameterzahl.
(Siehe die frühe Kurzplanungs-Tabelle für die Bereiche 64 / 128 / 192GB.)
LLM-Inferenz nach Modellklasse
Kleine und mittlere LLMs
Bei 7B–32B-Chat zählen Rechenleistung, Software-Reife, Kosten und Strom oft mehr als die Jagd nach 192GB. Ein KI-Mini-PC mit AMDs 128-GB-Option kann der rationale Kauf sein, wenn Ihre Modelle bereits passen.
Modelle der 70B-Klasse
Hier dominieren Speicherkapazität, Quantisierung und Bandbreite gemeinsam. Beide 128GB-Plattformen spielen im selben Club; der Unterschied wird CUDA vs. ROCm sowie die Aufteilung Ihres Szenarios auf Prefill und Decode sein.
120B+-Modelle
Kapazität wird Tor Nr. 1. Quantisierung und Kontextpolitik entscheiden, ob das System nutzbar ist. Die 192GB-Konfiguration zielt auf dieses Band mehr als auf „schnelleren 14B-Chat“.
Große MoE-Modelle
Gesamtparameter ≠ aktive Parameter. Ein 200B+-MoE kann auf Folien bedrohlich wirken und pro Token weit weniger Experten aktivieren. Sie brauchen trotzdem Kapazität für Gewichte auf Disk/im Speicher, aber die Decode-Kosten folgen aktiver Arbeit plus Routing-Overhead. Runtime-Qualität zählt so sehr wie die Schlagzeilen-Parameterzahl – deshalb gehört MoE in jede ernsthafte Anleitung zur Deskside-Inferenz.
Warum Modelle mit 200B+ Parametern nicht immer so schwer wirken, wie sie aussehen
Dichte Modelle halten die meisten Parameter pro Token heiß. MoE-Modelle aktivieren nur manche Experten, sodass die Rechenlast pro Token geringer wirken kann als die Schlagzeilen-Parameterzahl.
Sparse Activation senkt die Rechenlast pro Token, entfernt aber nicht den Bedarf, die Modellgewichte zu speichern. Deshalb kann ein großes MoE weiterhin Kapazität der 192GB-Klasse brauchen, selbst wenn Decode machbar wirkt – und deshalb müssen Gesamtparameter, Gewichtsabdruck, aktive Parameter, KV-Cache und gemessene Tokens/s in jeder LLM-Benchmark-Lektüre getrennt bleiben.
Warum LLM-Benchmarks irreführen können
Prefill vs Decode
Prefill verarbeitet den Eingabe-Prompt (oft rechenintensiv, parallel).
Decode gibt Tokens einzeln aus (oft bandbreiten-/latenzempfindlich).
Diese Aufteilung erklärt auch, warum DGX-Spark-Leistungszahlen über Tests hinweg ungleich wirken können: Prefill kann in einem Setup stark auseinanderklaffen, während Decode nah beieinander bleibt. Eine Box kann sich bei einem kurzen Chatbot schnell und bei „analysiere dieses 20k-Token-Repo“ langsam anfühlen.
Tokens pro Sekunde sind nicht die ganze Geschichte
Ergebnisse bewegen sich mit Promptlänge, Kontext, Batch-Größe, Quantisierung, Backend, Modell und Runtime. Eine einzelne Spark-Kennzahl, die als DGX-Spark-Benchmark oder LLM-Benchmark ohne diese Labels ausgewiesen wird, ist unvollständig.
Warum zwei Benchmarks unterschiedliche Ergebnisse zeigen
Öffentliche Vergleichsläufe sind als Richtungsbeleg nützlich – nicht als plattformweites Ranking.

| Testbedingung | DGX Spark | Strix |
|---|---|---|
| Modell | GPT-OSS 120B MXFP4 | GPT-OSS 120B MXFP4 |
| Quantisierung | MXFP4 (wie veröffentlicht) | MXFP4 (wie veröffentlicht) |
| Runtime | llama.cpp | llama.cpp |
| Prefill | ~1.723 tok/s | ~340 tok/s |
| Decode | ~38,6 tok/s | ~34,1 tok/s |
| Was es nahelegt | Stärkere Prompt-Verarbeitung in diesem Test | Deutlich nähere Generierungsgeschwindigkeit |
Quellen: HardwareCorner, IntuitionLabs, Memeburn.
In diesem veröffentlichten Vergleich zeigte Spark einen deutlichen Prefill-Vorsprung, während die Decode-Ergebnisse viel näher lagen – nützlich für promptlastige Workflows, kein Universalsieger für jede lokale LLM-Aufgabe.
CUDA vs ROCm: der Software-Unterschied
CUDA auf Spark
In Threads zu DGX Spark vs. AMD ist CUDA oft die echte Entscheidung: Framework-Support, TensorRT-LLM-/vLLM-Pfade, Fine-Tune-Rezepte und weniger Zeit mit Forks – selbst wenn 128GB-AMD-Boxen existieren.
ROCm und AMD-Hardware
Auf Systemen der Strix-/Gorgon-Klasse läuft reale KI- und LLM-Inferenz oft über ROCm, Vulkan, Llama.cpp, Ollama, LM Studio und Co. Der Stack funktioniert; er kann mehr Bedienaufwand brauchen.
Warum Software die Hardware-Leistung verändern kann
Gleiches Silizium, anderes Backend → anderes Prefill/Decode. Inferenzgeschwindigkeit ist ein Stack, keine Chip-Spezifikation.
KI-Anwendung
↓
Modell / Quantisierung
↓
Inferenz-Runtime
↙ ↘
CUDA ROCm/Vulkan
↘ ↙
GPU / APU
↓
Speicherarchitektur
↓
Kühlung / Leistung

Hardware-Fähigkeit vs Aufwand bei der Inbetriebnahme
Rohspezifikationen sind nur die Hälfte des Kaufs. Die andere Hälfte ist, wie schmerzhaft es ist, ein Modell zuverlässig zu servieren:
- NVIDIA-Pfad: CUDA-native Werkzeuge, mehr „läuft einfach“-Rezepte für gängige Stacks (vLLM / TensorRT-LLM / Playbooks). Oft zahlen Sie einen Aufpreis für weniger Setup-Reibung – nicht nur für einen Tokens/s-Screenshot.
- AMD-Pfad: Viele reale Deskside-Setups laufen über llama.cpp, Vulkan, Ollama, LM Studio und ROCm, wo unterstützt. Es funktioniert; der Bedienaufwand variiert stärker nach Modell/Runtime.
Also lautet „lohnt Spark gegenüber einer 128GB-AMD-Box?“ oft: CUDA-Ökosystem + weniger Reibung + die veröffentlichte Prefill-Lücke in manchen Vergleichstests – gegen Preis, Windows-/x86-Komfort und Decode, der nah liegen kann.
Szenario-Experimente (aus echten Nutzerfragen)
Statt Reddit-Tokens/s zu kippen, übersetzen Sie wiederkehrende LocalLLM-Debatten in Tests:
Szenario 1 – „Ich will ein 70B-Modell lokal betreiben.“ Prüfen Sie Kapazität → Quantisierung → Bandbreite → Runtime.
Szenario 2 – „Ich will einen lokalen Coding-Agenten.“ Prüfen Sie Kontext + KV-Cache → Decode-Gefühl → Agenten-Tooling (CUDA kann zählen).
Szenario 3 – „Ich will 120B+.“ Prüfen Sie zuerst Kapazität → Quant → ob das System mit mehr Speicher für Ihre Prompts mehr hilft als NVIDIAs Prefill-Pfad.
Szenario 4 – „Ich will mehrere Modelle dauerhaft im Speicher.“ Prüfen Sie freien Speicher nach OS/Runtime → Parallelität → Thermik bei langen Läufen.
Mini-PC vs kompakte KI-Workstation für lokale LLMs
Wenn Sie einen Strix-basierten Mini-PC für lokale KI wählen, schauen Sie über den Prozessor-Namen hinaus. Speicherkapazität, Kühlung, Speichererweiterung und Dauerleistung zählen für lange Inferenz-Szenarien mehr als das Broschüren-Label.
| Anwendung | Mini-PC | Kompakte KI-Workstation |
|---|---|---|
| Chatbot / leichte Agenten | ✓ | ✓ |
| Coding-Assistent / RAG | ✓ | ✓ |
| Großes LLM / Multi-Modell | Hängt von Speicher + Kühlung ab | Besser geeignet |
| Lange Inferenzläufe | Hängt von der Thermik ab | Besser geeignet |
| Erweiterung (USB4 / OCuLink) | Begrenzt | Mehr Optionen |
Keine Bauform gewinnt universell – passen Sie das Lastprofil an. Und für Deskside-LLM-Inferenz gilt: NPU-TOPS ≠ LLM-Geschwindigkeit: GPU-/APU-Rechenleistung, Unified Memory und Runtime dominieren.
Wo passt ACEMAGIC hinein?
Welche ACEMAGIC-Konfiguration passt zu welchem Szenario?
| Wenn Sie brauchen… | Was sich für Sie ändert | In Betracht ziehen |
|---|---|---|
| 128GB decken bereits Gewichte + KV + Extras ab | Kompaktes Deployment; niedrigere Speicherdecke; genug für viele Workflows der 70B-Klasse | |
| 128GB + 2-l-F9A-Gehäuse mit OCuLink | Gleiche Decke der Strix-Klasse, dichtere F9A-Bauform | F9A (Ryzen AI Max+ 395) – siehe Produktkarte oben |
| Mehr dauerhaft verfügbaren Speicherspielraum ohne aggressives stärkeres Quantisieren | 192GB-Decke (Gorgon-/Max+-PRO-495-Klasse); mehr Luft für Gewichte, KV und Multi-Service | F9A-PRO495 |
| Windows-/x86-Desktoparbeit neben dem Modell | Alltags-PC-Software + lokale Inferenz in einer AMD-Deskside-Box | AMD-basierte ACEMAGIC-Systeme |
Lokale KI-Hardware vs Cloud-GPUs
Wann lokale Hardware Sinn ergibt
Privatsphäre, wiederholte Inferenz, Offline-Arbeit, vorhersehbare tägliche Agenten, Entwicklungsloops, die Sie stündlich fahren.
Wann Cloud-GPUs mehr Sinn ergeben
Gelegentliche Riesenjobs, Burst-Training, Modelle, die weiterhin nicht passen, verteilte Experimente.
Wie Sie Gesamtkosten denken sollten
Preisen Sie die Stunden, die Sie wirklich fahren – nicht eine virale „amortisiert sich in N Monaten“-Behauptung ohne Ihre Token-Logs. Lokal gewinnt bei Privatsphäre und Grenzkosten; Cloud gewinnt bei Elastizität.
So wählen Sie lokale LLM-Hardware 2026
- Starten Sie bei der Modellgrößenklasse – 7B / 14B / 32B / 70B / 120B+ – und addieren Sie sofort Kontext und Multi-Service-Bedarf.
- Prüfen Sie die Speicherkapazität – passt das gesamte Working Set?
- Prüfen Sie Speicherbandbreite + Rechenleistung – fühlt sich Decode akzeptabel an?
- Prüfen Sie die Kontextlänge – KV-Cache und Prefill-Pfad.
- Prüfen Sie die Software – CUDA nötig oder ROCm/llama.cpp okay?
- Prüfen Sie Thermik/Bauform – Betriebsprofil Mini-PC vs. Workstation.
Entscheidungsmatrix für lokale KI-Hardware
| Ihre Priorität | Was am meisten zählt |
|---|---|
| Größtes Modell betreiben | Speicherkapazität |
| Schnellere Token-Generierung | Speicherbandbreite + Rechenleistung |
| Coding mit langem Kontext | Speicher + KV-Cache |
| RAG | Prefill + Speicher |
| MoE-Modelle | Kapazität + Runtime |
| KI-Entwicklung | Software-Ökosystem |
| Mehrere Modelle | Speicherkapazität |
| Kleines kompaktes System | Leistung + Thermik |
| Windows-Workstation | x86-Kompatibilität |
| CUDA-Entwicklung | NVIDIA-Software-Stack |
Es gibt keine einzige Gewinner-Tabelle. Bei Stacks der 128GB-Klasse entscheiden Sie nach Software, Prefill-/Decode-Verhalten und Systemdesign. Überschreiten Sie die Kapazitätswand, und 192GB ist eine andere Klasse von Vorteil – keine höhere Benchmark-Zahl.
Zusammenfassung
Die Wahl unter diesen drei Deskside-Optionen hängt vom Szenario-Fit ab, nicht von einem einzelnen Gewinner:
- Kapazität ≠ Geschwindigkeit. 192 GB hilft, wenn Gewichte, KV-Cache oder Multi-Service-Stacks in 128 GB nicht passen – es erhöht die Tokens/s nicht automatisch.
- Prefill ≠ Decode. Im veröffentlichten GPT-OSS-120B-MXFP4-llama.cpp-Vergleichstest lag Sparks Prefill weit vorn, während Decode nah blieb – als Richtung lesen, nicht als Universalranking.
- 128GB-Klasse: NVIDIAs CUDA-/weniger-Reibungs-Pfad gegen AMDs x86-Strix-Desktop-Pfad (z. B. M1A PRO+ oder F9A-395), je nach Software-Stack und Bauform.
- 192GB-Klasse: Wenn der Working Set die Wand ist, bildet F9A-PRO495 den Max+ PRO 495 / 192GB LPDDR5X-8533 (Radeon 8065S) ab. „Gorgon“ bleibt hier der frühere Codename/die Käufer-Kurzform für diese Stufe.
- Kaufen Sie den Flaschenhals, den Sie wirklich haben: zuerst Fit, dann Bandbreite/Rechenleistung, dann CUDA- vs. ROCm-/llama.cpp-Reibung, dann Thermik und Erweiterung.
FAQ
Lohnt sich die NVIDIA-Box mit 128GB gegenüber der AMD-Option mit 128GB für lokale LLM-Inferenz?
Es kommt darauf an, was Sie kaufen. Im veröffentlichten GPT-OSS-120B-MXFP4-Vergleichstest oben lag Sparks Prefill weit vorn, während Decode nah dran war. Der Aufpreis kauft häufiger CUDA-Ökosystem, weniger Aufwand bei der Inbetriebnahme und DGX-orientierte Werkzeuge – keine universelle 5×-Generierungs-Behauptung. AMDs 128GB-Option bleibt für viele decode-lastige Windows-/x86-KI-Mini-PC-Setups wettbewerbsfähig.
Wie viel RAM brauche ich, um ein 70B-LLM lokal zu betreiben?
Planen Sie Gewichte + KV-Cache + Runtime + Extras, nicht nur das Parameter-Label. Viele Setups der 70B-Klasse sind in einem 128GB-Unified-Memory-Pool bei gängigen Quants komfortabel; langer Kontext, höhere Quants oder Multi-Service-Stacks erhöhen das Budget. Nutzen Sie die Planungstabelle oben – sie ist Orientierung, keine harte Grenze.
Kann ich 120B-Modelle auf 128GB Unified Memory betreiben?
Ja, mit starker Quantisierung und begrenzter Kontextlänge – aber Sie verlieren Spielraum für KV-Cache, Embedding-Modelle und Reranker. Dort schafft Hardware der Gorgon-Klasse mit 192GB Mehrwert. Fit bleibt das erste Tor; nutzbare Geschwindigkeit das zweite. Kapazitätsangaben zu 120B Q4 oder „bis 300B MoE“ sind Fit-Ziele (Quantisierung + Kontext + Runtime), keine Tokens/s-Zusage.
Ist 192GB besser als 128GB für lokale LLMs?
192 GB bieten mehr Modell- und KV-Cache-Spielraum, erhöhen Tokens/s aber nicht automatisch, wenn das Szenario bereits in 128 GB passt. Wählen Sie es für speicherbegrenzte Stacks (höhere Quants, Multi-Modell, langer Kontext, größere MoE-Gewichte) – nicht als kostenlosen Geschwindigkeitsvorteil.
Wann zählt die 192GB-Konfiguration mehr als jede der beiden 128GB-Boxen?
Wenn das Working Set nicht mehr passt: Multi-Modell-RAG, größere MoE-Gewichtsdateien, höhere Quants oder lange KV-Caches. Siehe auch die FAQ 192GB vs 128GB oben.
Bedeutet mehr Unified Memory schnellere Tokens/s?
Nein. Gewichte unterzubringen ist nicht dasselbe wie Tokens schnell zu erzeugen – Bandbreite, Rechenleistung, Quantisierung und Runtime setzen weiterhin das Tempo.
Sind NPU-TOPS ein guter Weg, On-Device-LLM-Hardware zu wählen?
Meist nein. Für Deskside-LLM-Inferenz dominieren GPU/APU + Speicher + Software die Inferenz-Ergebnisse stärker als NPU-TOPS-Folien.
Mini-PC oder Deskside-Workstation?
Chat und leichte Agenten passen oft in einen Mini-PC. Große Modelle, Multi-Service-RAG und lange Inferenzläufe neigen zur Workstation – inklusive einer kompakten Workstation wie dem F9A, wenn Sie Speicher der 192GB-Klasse brauchen.
Quellen
- AMD Ryzen AI Max+ PRO 495 (früherer Codename Gorgon; max. 192GB; Radeon 8065S)
- AMD Ryzen AI Max+ 395 / Strix Halo (max. 128GB LPDDR5X-8000)
- NVIDIA DGX Spark Produktspezifikationen
-
HardwareCorner Spark-LLM-Benchmarks; IntuitionLabs; Memeburn










