Zum Inhalt springen
·

🔥 Ryzen 7 7730U | 1TB statt 512GB – nur 10€ mehr! → Jetzt upgraden

F5A AI470 |Mehr erfahren|Kostenloser Versand|Jetzt erhältlich

Brauchen Sie Hilfe bei Ihrer Bestellung? | Kontaktieren Sie jetzt unseren Support!

DGX Spark vs Strix Halo vs Gorgon Halo: Welche Hardware für lokale KI passt zu Ihnen?

von US CHERRY 17 Sep 2026 0 Kommentare

DGX Spark vs Strix Halo vs Gorgon Halo: Welche Plattform passt zu Ihrem lokalen LLM-Szenario?

Ein System mit 192GB ist nicht automatisch schneller als eines mit 128GB. Eine Spezifikation von 1 PFLOP sagt nicht, wie schnell ein LLM Token erzeugt. Und ein Benchmark ohne getrennte Prefill- und Decode-Werte kann ein verzerrtes Bild der realen Arbeitsgeschwindigkeit zeichnen.

Diese Unterschiede zählen, wenn Sie die NVIDIA-Plattform, die AMD-Option mit 128GB und neuere Konfigurationen der 192GB-Klasse für lokale KI / lokale LLMs vergleichen.

DGX Spark vs Strix Halo vs Gorgon Halo

Alle drei können Anwendungen abdecken, die früher zu großen Towern mit diskreter GPU gedrängt haben: private Inferenz, Coding-Agenten, RAG, langer Kontext und Multi-Modell-Pipelines. Sie lösen diese Probleme nur auf unterschiedliche Weise.

Vergleichen Sie sinnvoll so:

  1. Passen Modell und Arbeitsdaten in den Speicher?
  2. Wie schnell verarbeitet das System einen langen Prompt (Prefill)?
  3. Wie schnell erzeugt es Tokens (Decode)?
  4. Hängt Ihre Software von CUDA ab?
  5. Was passiert, wenn Ihr Szenario über 128GB hinauswächst?

Die wichtigste Unterscheidung bleibt:

Die Speicherkapazität bestimmt, was hineinpasst. Speicherbandbreite, Rechenleistung, Quantisierung und Software bestimmen, wie schnell es läuft.

Zentrale Frage dieser Anleitung: Wie wählen Sie zwischen dem NVIDIA-Gerät mit 128GB, der AMD-Strix-Option mit 128GB und Systemen der Gorgon-Kurzbezeichnung in der 192GB-Klasse für lokale LLM-Inferenz – besonders die Kapazitätsgabel 128GB vs 192GB – ohne einen einzelnen Tokens/s-Screenshot als Ranking zu behandeln.

Schnellvergleich

Merkmal DGX Spark Strix Halo Gorgon Halo
Hauptplattform NVIDIA Grace Blackwell (NVIDIA Blackwell) AMD Zen 5 + Radeon-APU AMD-Deskside-Klasse mit mehr Speicher
Unified Memory 128GB Bis 128GB in Flaggschiff-Systemen Bis 192GB (Konfigurationen der Max+-PRO-495-Klasse)
Speicherbandbreite 273 GB/s angegeben 256 GB/s (LPDDR5X-8000, AMD-Peak) 273 GB/s theoretischer Peak (256-Bit × LPDDR5X-8533)
Software CUDA / DGX OS ROCm / Vulkan / llama.cpp / Ollama ROCm / Vulkan / llama.cpp / Ollama
Bauform Kompaktes KI-Gerät KI-Mini-PC / kompakte Workstation Kompakte KI-Workstation
Bester Kaufgrund CUDA-orientierte Entwicklung + starkes Prefill in einigen veröffentlichten Tests Lokale Inferenz mit 128GB plus normaler x86-PC Anwendungen, die 128GB wirklich überschreiten

Diese Tabelle ordnet die Plattformen ein. Sie bedeutet nicht, dass eine Spalte universell schneller ist – das hängt vom Szenario ab.

AMD listet Gorgon Halo als früheren Codenamen auf der Seite zum Ryzen AI Max+ PRO 495 (bis 192GB, Radeon 8065S). Hier nutzen wir ihn als Käufer-Kurzform für diese Deskside-Stufe mit 192GB, nicht als eigene Consumer-Architekturmarke.

Infografik zum Vergleich dreier KI-Plattformen: NVIDIA DGX Spark, AMD Strix Halo und AMD Gorgon Halo mit Speicherkapazitätsbalken bei 128GB, 128GB und 192GB sowie Bandbreiten- und Software-Stack-Indikatoren

Kurzplanung: Was 128GB vs 192GB typischerweise bringt

Nur Orientierung zur Planung – keine harte Modellgrenze. Quantisierung, Kontextlänge und Multi-Service-Stacks verschieben die reale Zahl.

Unified Memory Praktische Rolle (nur Planung)
~64GB 7B–32B komfortabel; größere Modelle nur mit aggressiver Quantisierung
128GB 70B-Klasse komfortabel; manche 120B-/MoE-Szenarien je nach Quantisierung und Kontext
192GB Höhere Quants, größere MoE-Gewichtsdateien, Multi-Modell-Stacks, mehr KV-Cache-Spielraum

Wenn 128GB bereits mit Reserve passen, behandeln Sie 192GB als Kapazitätspuffer.

Drei-Stufen-Diagramm der Unified-Memory-Kapazität: 64GB für 7B–32B-Modelle, 128GB für die 70B-Klasse und 192GB für große MoE-Modelle und Multi-Service-Stacks

Flaschenhals-Karte für LLM-Hardware

Anwendung Erster Flaschenhals Zweiter Flaschenhals Warum
7B-Chat Rechenleistung / Software Speicher Modell ist relativ klein
32B-Chat Bandbreite Rechenleistung Decode wird speicherempfindlicher
70B Kapazität Bandbreite Gewichtsabdruck steigt stark
120B+ Kapazität Bandbreite Einpassen wird zur ersten Grenze
Langer Kontext KV-Cache Speicher Kontext erhöht Cache-Bedarf
Coding-Agent Kontext + KV Decode Lange Prompts + Generierung
RAG Prefill Speicherbandbreite Viele Eingabe-Tokens
MoE Kapazität + Runtime Bandbreite Gesamtparameter und aktive Parameter unterscheiden sich

Diese Karte ist der eigentliche Einkaufsleitfaden für diese Plattformen 2026 – nicht ein einzelner Tokens/s-Screenshot.

Warum genau diese drei Plattformen verglichen werden

Vom AI-PC zur lokalen Workstation

Marketing rund um „AI PC“ stützt sich weiterhin auf NPU-TOPS. Wer ernsthaft lokale LLMs kauft, achtet eher auf Unified Memory, GPU-/APU-Inferenzpfade und darauf, ob die Box private Agenten, RAG und Arbeit mit langem Kontext auf dem Schreibtisch hosten kann – deshalb tauchen NVIDIA DGX Spark, AMD Strix Halo (128GB) und Konfigurationen der 192GB-Klasse gemeinsam auf, wenn nach KI-Mini-PC- bzw. kompakter Workstation-Hardware gesucht wird.

Warum Speicherkapazität zur Schlüssel-Spezifikation wurde

Sobald Gewichte der 70B-Klasse und 120B+ lokal geladen wurden, klangen 128GB und 192GB nicht mehr nach Luxus, sondern nach „Lädt das überhaupt?“. Unified Memory erklärt, warum diese drei Desktop-Optionen zusammen Aufmerksamkeit bekommen: Sie versprechen einen gemeinsamen Pool, der groß genug für lokale LLM-Hardware ist, die früher Multi-GPU-Tower brauchte.

(Chip-Unterschiede 128GB vs. 192GB finden Sie in unserem Vergleich Ryzen AI Max+ 395 vs PRO 495. Auf der AMD-Produktseite listet der Ryzen AI Max+ PRO 495 den früheren Codenamen Gorgon Halo, Radeon 8065S (40 CUs) und max. 192GB LPDDR5X-8533 – das ist das Silizium der 192GB-Klasse, das diese Anleitung auf Deskside-SKUs abbildet.)

Was ist AMD Strix Halo?

Plattform und Ryzen AI Max

Strix Halo ist AMDs High-End-APU-Plattform: eine starke Zen-5-CPU, eine große Radeon-iGPU und ein breiter LPDDR5X-Unified-Memory-Bus in kompakten Systemen. Käufer tippen meist AMD Strix Halo; der Ryzen AI Max+ 395 (häufig auch als Ryzen AI Max 395 gesucht) gehört zu den bekanntesten Chips, die diese Plattform in Strix-Halo-Mini-PC- und Workstation-SKUs umsetzen (einschließlich des Profils Ryzen AI Max+ 395 128GB).

Grundlagen zu Plattform und Bauform finden Sie in unserem Überblick zum Strix-Halo-Mini-PC für lokale KI. Wenn Sie einen Strix-Halo-PC mit Appliance-Systemen vergleichen, starten Sie dort.

Warum Strix für lokale KI interessant ist

Die Plattform zählt für lokale KI, weil sie kombiniert:

  • Einen großen Unified-Memory-Pool (häufig bis 128GB in Flaggschiff-Konfigurationen wie Strix Halo 128GB)
  • Echte GPU-Rechenleistung für LLM-Inferenz (nicht nur NPU-Marketing)
  • Kompakte Gehäuseoptionen – von kompakten AMD-Mini-PC-Designs bis zu dichteren Deskside-Boxen
  • Genug Spielraum für alltägliche x86-Software neben dem Modell

Es ist kein „diskreter 4090 im Winzgehäuse“. Es ist ein APU-first-Ansatz: große Gewichte in einem Pool unterbringen, akzeptieren, dass Decode oft speicherbandbreitengebunden ist, und den Software-Pfad optimieren (ROCm, Vulkan, llama.cpp, Ollama).

Was ist AMD Gorgon Halo?

Das ist die Informationslücke, die die meisten Spark-vs-Strix-Beiträge noch übersehen.

Kapazität: 128GB vs AMD der 192-GB-Klasse

AMDs eigene Produktseite listet Gorgon Halo als früheren Codenamen für den Ryzen AI Max+ PRO 495 (Radeon 8065S, 40 CUs, bis 192GB LPDDR5X-8533). In dieser Anleitung bleibt „Gorgon Halo“ vor allem eine Käufer-Kurzform für diese Deskside-Stufe mit 192GB – nicht als eigene Consumer-Architekturmarke, nach der Sie suchen müssten.

Für Käufer ist die nützliche Unterscheidung einfacher:

  • AMDs Option der 128GB-Klasse → oft ausreichend für viele dauerhaft im Speicher geladene lokale LLM-Stacks
  • die 192GB-Konfiguration → mehr Raum, wenn Gewichte, KV-Cache und Multi-Service-Stacks nicht mehr passen

Gegenüber Strix ist das also vor allem eine Kapazitätsgeschichte (mit konfigurationsabhängigen Takten und Speicheraufteilungen), gezielt auf Anwendungen, die bereits an der 128GB-Wand scheitern – Multi-Service-RAG, längerer Kontext, größere MoE-Gewichtsdateien, höhere Quants.

Gegenüber dem NVIDIA-Gerät mit 128 GB ist die Frage wieder eine andere: Die NVIDIA-Box bleibt auf CUDA und einen kohärenten 128-GB-Pool ausgerichtet; die AMD-Systeme mit mehr Speicher beantworten „Was, wenn 128GB dauerhaft geladener Speicher die echte Wand ist?“

Warum höhere Speicherkapazität für lokale LLMs zählt

Kapazität zeigt sich bei größeren Gewichten, längeren KV-Caches, Multi-Service-Stacks oder weniger aggressiver Quantisierung.

Ist mehr Speicher immer besser?

Nein. Kapazität legt fest, was Sie laden können; die Geschwindigkeit folgt weiterhin Bandbreite, Rechenleistung und Software.

Geteilte Konzeptgrafik: links ein leuchtender Speicherpool mit Modellgewicht-Blöcken als Kapazität, rechts eine Datenautobahn mit strömenden Tokens als Speicherbandbreite und Decode-Geschwindigkeit

Was ist NVIDIA DGX Spark?

Spezifikationen, die für KI zählen

Laut NVIDIA-Produktseite sind die DGX-Spark-Spezifikationen, die für lokale KI / LLM-Inferenz (und für vorsichtiges Lesen von Leistungsangaben) zählen, in etwa:

  • NVIDIA GB10 Grace-Blackwell-Superchip (NVIDIA Blackwell GPU)
  • 128GB kohärenter Unified Memory bei angegebenen 273 GB/s
  • FP4-Klassen-Tensor-Marketingleistung (bis ~1 PFLOP Sparse FP4 – theoretisch)
  • CUDA-Software-Stack, DGX OS, Playbooks / NIM-orientierte Werkzeuge
  • Schneller lokaler Speicher (Founders-Konfigurationen mit großem NVMe)
  • ConnectX-7-Netzwerk für Multi-Box-Scale-out-Szenarien

Der Listenpreis der Founders Edition liegt derzeit bei 4.699 USD (nur Preisrahmen – diese Anleitung ist keine Preisübersicht).

Warum CUDA zur Spark-Story gehört

Für viele Käufer ist die NVIDIA-Plattform nicht „noch eine 128-GB-Box“. Sie ist der Zugang zum CUDA-Ökosystem: Frameworks, Kernel, Fine-Tune-Rezepte und Serving-Stacks, die bereits NVIDIA voraussetzt. Diese Software-Schicht ist Teil der gemessenen LLM-Leistung, kein Zubehör.

Wichtige Hardware-Unterschiede (Detail)

Der Schnellvergleich oben reicht für die meisten Käufer. Diese Tabelle ergänzt die dichtere Spezifikationsebene.

Merkmal Spark Strix Gorgon
Architektur Grace Blackwell (GB10) Strix-APU-Familie Max+-PRO-495-Klasse / AMD-Deskside mit mehr Speicher
CPU 20-Kern-Arm Zen 5 x86 (Strix-Klasse) Zen 5 x86 (PRO-495-Klasse)
GPU Blackwell GPU Radeon-iGPU (z. B. Radeon 8060S) Radeon-iGPU (z. B. 8065S-Klasse)
Unified Memory 128GB Typisch bis 128GB Bis 192GB
Speicherbandbreite 273 GB/s angegeben 256 GB/s (LPDDR5X-8000, AMD-Peak) 273 GB/s theoretischer Peak (256-Bit × LPDDR5X-8533); OEM-Dauerwerte TBD
KI-Rechenleistung (Marketing) ~1 PFLOP FP4 Sparse Plattform-TOPS / iGPU Plattform-TOPS-Labels sind weiterhin ≠ LLM-tok/s
Software-Stack CUDA / DGX OS ROCm / Vulkan / llama.cpp ROCm / Vulkan / llama.cpp
Bauform Ultra-kompaktes Gerät KI-Mini-PC / kompakte Workstation Kompakte Workstation-SKUs
Hauptkaufargument CUDA-Ökosystem + veröffentlichtes Prefill in einigen Tests Kompakte AMD-Plattform mit 128GB Höhere Speicherkapazität für speicherbegrenzte Stacks

Die Spezifikationen, die für LLMs wirklich zählen

Für LLM-Inferenz sind drei Zahlen nicht austauschbar:

  1. Speicherkapazität – passen Gewichte + KV + Runtime?
  2. Speicherbandbreite – wie schnell kann Decode Gewichte bewegen?
  3. Rechenleistung + Software – wie schnell ist Prefill, und welche Kernel gibt es?

TOPS / PFLOPS allein beantworten diese Fragen nicht.

Speicherkapazität vs Speicherbandbreite für lokale LLMs

Warum 128GB wichtiger sein können als GPU-FLOPS

Passt das Modell nicht, sind FLOPS irrelevant. Deshalb drehen sich Gespräche über lokale LLM-Hardware um Strix Halo 128GB und den 128GB-Pool von Spark – und deshalb ist Gorgon 192GB für kapazitätsgebundene Nutzer eine echte Produktgeschichte.

Warum mehr Speicher nicht automatisch schnellere Inferenz bedeutet

Sobald das Working Set passt, hebt zusätzlicher RAM Tokens/s selten von allein. Decode auf Unified-Memory-APUs ist oft speicherbandbreitengebunden. Extra-Kapazität reduziert vor allem Swapping, Unloading und erzwungenes stärkeres Quantisieren.

Was Speicherbandbreite verändert

Bandbreite zeigt sich am stärksten bei:

  • Decode (Token-für-Token-Generierung)
  • Gewichtsstroming bei großen dichten Modellen
  • speichergebundener LLM-Geschwindigkeit, wenn die GPU auf den Bus wartet

Sparks angegebene 273 GB/s und Strix’ Peak von 256 GB/s helfen zu erklären, warum Generierungslücken in manchen öffentlichen Vergleichsläufen bescheiden wirken – selbst wenn Prefill-Lücken groß aussehen. Konfigurationen der Max+-PRO-495-Klasse mit 192GB landen ebenfalls bei einem theoretischen Peak von 273 GB/s aus 256-Bit × LPDDR5X-8533 (OEM-Dauerwerte können abweichen).

Was passiert, wenn Sie mehr Kontext hinzufügen?

Längerer Kontext wächst den KV-Cache. Coding-Agenten und RAG, die riesige Prompts erneut senden, belasten Prefill und Cache-Abdruck. Das ist eine andere Flaschenhals-Karte als kurze Chatbot-Turns.

Warum Modellgröße allein nicht mehr reicht, um lokale KI-Hardware zu wählen

„Wie viele GB für ein 70B-Modell?“ ist die falsche Standalone-Frage.

Ein praktisches Speicherbudget für lokale LLMs:

  1. Modellgewichte (abhängig von der Quantisierung)
  2. KV-Cache (abhängig von der Kontextlänge)
  3. Runtime-Overhead (Framework, CUDA-/ROCm-Graphs, OS)
  4. Kontext/Tools (Agent-Scratch, Retrieval-Puffer)
  5. Mehrere Modelle/Dienste (Embedder, Reranker, zweites LLM)

Dieselbe „70B“-Bezeichnung kann in einem Stack auf 128GB komfortabel und in einem anderen schmerzhaft sein. Kapazitätsplanung ist eine Summe, keine Parameterzahl.

(Siehe die frühe Kurzplanungs-Tabelle für die Bereiche 64 / 128 / 192GB.)

LLM-Inferenz nach Modellklasse

Kleine und mittlere LLMs

Bei 7B–32B-Chat zählen Rechenleistung, Software-Reife, Kosten und Strom oft mehr als die Jagd nach 192GB. Ein KI-Mini-PC mit AMDs 128-GB-Option kann der rationale Kauf sein, wenn Ihre Modelle bereits passen.

Modelle der 70B-Klasse

Hier dominieren Speicherkapazität, Quantisierung und Bandbreite gemeinsam. Beide 128GB-Plattformen spielen im selben Club; der Unterschied wird CUDA vs. ROCm sowie die Aufteilung Ihres Szenarios auf Prefill und Decode sein.

120B+-Modelle

Kapazität wird Tor Nr. 1. Quantisierung und Kontextpolitik entscheiden, ob das System nutzbar ist. Die 192GB-Konfiguration zielt auf dieses Band mehr als auf „schnelleren 14B-Chat“.

Große MoE-Modelle

Gesamtparameter ≠ aktive Parameter. Ein 200B+-MoE kann auf Folien bedrohlich wirken und pro Token weit weniger Experten aktivieren. Sie brauchen trotzdem Kapazität für Gewichte auf Disk/im Speicher, aber die Decode-Kosten folgen aktiver Arbeit plus Routing-Overhead. Runtime-Qualität zählt so sehr wie die Schlagzeilen-Parameterzahl – deshalb gehört MoE in jede ernsthafte Anleitung zur Deskside-Inferenz.

Warum Modelle mit 200B+ Parametern nicht immer so schwer wirken, wie sie aussehen

Dichte Modelle halten die meisten Parameter pro Token heiß. MoE-Modelle aktivieren nur manche Experten, sodass die Rechenlast pro Token geringer wirken kann als die Schlagzeilen-Parameterzahl.

Sparse Activation senkt die Rechenlast pro Token, entfernt aber nicht den Bedarf, die Modellgewichte zu speichern. Deshalb kann ein großes MoE weiterhin Kapazität der 192GB-Klasse brauchen, selbst wenn Decode machbar wirkt – und deshalb müssen Gesamtparameter, Gewichtsabdruck, aktive Parameter, KV-Cache und gemessene Tokens/s in jeder LLM-Benchmark-Lektüre getrennt bleiben.

Warum LLM-Benchmarks irreführen können

Prefill vs Decode

Prefill verarbeitet den Eingabe-Prompt (oft rechenintensiv, parallel).

Decode gibt Tokens einzeln aus (oft bandbreiten-/latenzempfindlich).

Diese Aufteilung erklärt auch, warum DGX-Spark-Leistungszahlen über Tests hinweg ungleich wirken können: Prefill kann in einem Setup stark auseinanderklaffen, während Decode nah beieinander bleibt. Eine Box kann sich bei einem kurzen Chatbot schnell und bei „analysiere dieses 20k-Token-Repo“ langsam anfühlen.

Tokens pro Sekunde sind nicht die ganze Geschichte

Ergebnisse bewegen sich mit Promptlänge, Kontext, Batch-Größe, Quantisierung, Backend, Modell und Runtime. Eine einzelne Spark-Kennzahl, die als DGX-Spark-Benchmark oder LLM-Benchmark ohne diese Labels ausgewiesen wird, ist unvollständig.

Warum zwei Benchmarks unterschiedliche Ergebnisse zeigen

Öffentliche Vergleichsläufe sind als Richtungsbeleg nützlich – nicht als plattformweites Ranking.

Balkendiagramm NVIDIA DGX Spark vs AMD Strix Halo bei GPT-OSS 120B MXFP4 mit llama.cpp: Prefill Spark ca. 1723 tok/s vs Strix 340 tok/s, Decode Spark 38,6 tok/s vs Strix 34,1 tok/s

Testbedingung DGX Spark Strix
Modell GPT-OSS 120B MXFP4 GPT-OSS 120B MXFP4
Quantisierung MXFP4 (wie veröffentlicht) MXFP4 (wie veröffentlicht)
Runtime llama.cpp llama.cpp
Prefill ~1.723 tok/s ~340 tok/s
Decode ~38,6 tok/s ~34,1 tok/s
Was es nahelegt Stärkere Prompt-Verarbeitung in diesem Test Deutlich nähere Generierungsgeschwindigkeit

Quellen: HardwareCorner, IntuitionLabs, Memeburn.

In diesem veröffentlichten Vergleich zeigte Spark einen deutlichen Prefill-Vorsprung, während die Decode-Ergebnisse viel näher lagen – nützlich für promptlastige Workflows, kein Universalsieger für jede lokale LLM-Aufgabe.

CUDA vs ROCm: der Software-Unterschied

CUDA auf Spark

In Threads zu DGX Spark vs. AMD ist CUDA oft die echte Entscheidung: Framework-Support, TensorRT-LLM-/vLLM-Pfade, Fine-Tune-Rezepte und weniger Zeit mit Forks – selbst wenn 128GB-AMD-Boxen existieren.

ROCm und AMD-Hardware

Auf Systemen der Strix-/Gorgon-Klasse läuft reale KI- und LLM-Inferenz oft über ROCm, Vulkan, Llama.cpp, Ollama, LM Studio und Co. Der Stack funktioniert; er kann mehr Bedienaufwand brauchen.

Warum Software die Hardware-Leistung verändern kann

Gleiches Silizium, anderes Backend → anderes Prefill/Decode. Inferenzgeschwindigkeit ist ein Stack, keine Chip-Spezifikation.

         KI-Anwendung
               ↓
     Modell / Quantisierung
               ↓
      Inferenz-Runtime
     ↙                  ↘
  CUDA                  ROCm/Vulkan
     ↘                  ↙
        GPU / APU
             ↓
     Speicherarchitektur
             ↓
      Kühlung / Leistung

Geschichtetes Pyramidendiagramm des KI-Inferenz-Software-Stacks von oben nach unten: KI-Anwendung, Modell/Quantisierung, Inferenz-Runtime, dann Aufteilung in CUDA-Pfad (grün) zur GPU und ROCm/Vulkan-Pfad (rot) zur APU, Zusammenführung bei Speicherarchitektur und Kühlung/Leistung

Hardware-Fähigkeit vs Aufwand bei der Inbetriebnahme

Rohspezifikationen sind nur die Hälfte des Kaufs. Die andere Hälfte ist, wie schmerzhaft es ist, ein Modell zuverlässig zu servieren:

  • NVIDIA-Pfad: CUDA-native Werkzeuge, mehr „läuft einfach“-Rezepte für gängige Stacks (vLLM / TensorRT-LLM / Playbooks). Oft zahlen Sie einen Aufpreis für weniger Setup-Reibung – nicht nur für einen Tokens/s-Screenshot.
  • AMD-Pfad: Viele reale Deskside-Setups laufen über llama.cpp, Vulkan, Ollama, LM Studio und ROCm, wo unterstützt. Es funktioniert; der Bedienaufwand variiert stärker nach Modell/Runtime.

Also lautet „lohnt Spark gegenüber einer 128GB-AMD-Box?“ oft: CUDA-Ökosystem + weniger Reibung + die veröffentlichte Prefill-Lücke in manchen Vergleichstests – gegen Preis, Windows-/x86-Komfort und Decode, der nah liegen kann.

Szenario-Experimente (aus echten Nutzerfragen)

Statt Reddit-Tokens/s zu kippen, übersetzen Sie wiederkehrende LocalLLM-Debatten in Tests:

Eigene KI-Agenten für Inhalte, Wissensmanagement und Automatisierung mit Enterprise-fähigen KI-Funktionen betreiben.

Szenario 1 – „Ich will ein 70B-Modell lokal betreiben.“ Prüfen Sie Kapazität → Quantisierung → Bandbreite → Runtime.

Szenario 2 – „Ich will einen lokalen Coding-Agenten.“ Prüfen Sie Kontext + KV-Cache → Decode-Gefühl → Agenten-Tooling (CUDA kann zählen).

Szenario 3 – „Ich will 120B+.“ Prüfen Sie zuerst Kapazität → Quant → ob das System mit mehr Speicher für Ihre Prompts mehr hilft als NVIDIAs Prefill-Pfad.

Szenario 4 – „Ich will mehrere Modelle dauerhaft im Speicher.“ Prüfen Sie freien Speicher nach OS/Runtime → Parallelität → Thermik bei langen Läufen.

Mini-PC vs kompakte KI-Workstation für lokale LLMs

Wenn Sie einen Strix-basierten Mini-PC für lokale KI wählen, schauen Sie über den Prozessor-Namen hinaus. Speicherkapazität, Kühlung, Speichererweiterung und Dauerleistung zählen für lange Inferenz-Szenarien mehr als das Broschüren-Label.

Anwendung Mini-PC Kompakte KI-Workstation
Chatbot / leichte Agenten ✓ ✓
Coding-Assistent / RAG ✓ ✓
Großes LLM / Multi-Modell Hängt von Speicher + Kühlung ab Besser geeignet
Lange Inferenzläufe Hängt von der Thermik ab Besser geeignet
Erweiterung (USB4 / OCuLink) Begrenzt Mehr Optionen

Keine Bauform gewinnt universell – passen Sie das Lastprofil an. Und für Deskside-LLM-Inferenz gilt: NPU-TOPS ≠ LLM-Geschwindigkeit: GPU-/APU-Rechenleistung, Unified Memory und Runtime dominieren.

Wo passt ACEMAGIC hinein?

Welche ACEMAGIC-Konfiguration passt zu welchem Szenario?

Wenn Sie brauchen… Was sich für Sie ändert In Betracht ziehen
128GB decken bereits Gewichte + KV + Extras ab Kompaktes Deployment; niedrigere Speicherdecke; genug für viele Workflows der 70B-Klasse

M1A PRO+

128GB + 2-l-F9A-Gehäuse mit OCuLink Gleiche Decke der Strix-Klasse, dichtere F9A-Bauform F9A (Ryzen AI Max+ 395) – siehe Produktkarte oben
Mehr dauerhaft verfügbaren Speicherspielraum ohne aggressives stärkeres Quantisieren 192GB-Decke (Gorgon-/Max+-PRO-495-Klasse); mehr Luft für Gewichte, KV und Multi-Service F9A-PRO495
Windows-/x86-Desktoparbeit neben dem Modell Alltags-PC-Software + lokale Inferenz in einer AMD-Deskside-Box AMD-basierte ACEMAGIC-Systeme

Desktop-Leistung in einer Mini-Workstation

Lokale KI-Hardware vs Cloud-GPUs

Wann lokale Hardware Sinn ergibt

Privatsphäre, wiederholte Inferenz, Offline-Arbeit, vorhersehbare tägliche Agenten, Entwicklungsloops, die Sie stündlich fahren.

Wann Cloud-GPUs mehr Sinn ergeben

Gelegentliche Riesenjobs, Burst-Training, Modelle, die weiterhin nicht passen, verteilte Experimente.

Wie Sie Gesamtkosten denken sollten

Preisen Sie die Stunden, die Sie wirklich fahren – nicht eine virale „amortisiert sich in N Monaten“-Behauptung ohne Ihre Token-Logs. Lokal gewinnt bei Privatsphäre und Grenzkosten; Cloud gewinnt bei Elastizität.

So wählen Sie lokale LLM-Hardware 2026

  1. Starten Sie bei der Modellgrößenklasse – 7B / 14B / 32B / 70B / 120B+ – und addieren Sie sofort Kontext und Multi-Service-Bedarf.
  2. Prüfen Sie die Speicherkapazität – passt das gesamte Working Set?
  3. Prüfen Sie Speicherbandbreite + Rechenleistung – fühlt sich Decode akzeptabel an?
  4. Prüfen Sie die Kontextlänge – KV-Cache und Prefill-Pfad.
  5. Prüfen Sie die Software – CUDA nötig oder ROCm/llama.cpp okay?
  6. Prüfen Sie Thermik/Bauform – Betriebsprofil Mini-PC vs. Workstation.

Entscheidungsmatrix für lokale KI-Hardware

Ihre Priorität Was am meisten zählt
Größtes Modell betreiben Speicherkapazität
Schnellere Token-Generierung Speicherbandbreite + Rechenleistung
Coding mit langem Kontext Speicher + KV-Cache
RAG Prefill + Speicher
MoE-Modelle Kapazität + Runtime
KI-Entwicklung Software-Ökosystem
Mehrere Modelle Speicherkapazität
Kleines kompaktes System Leistung + Thermik
Windows-Workstation x86-Kompatibilität
CUDA-Entwicklung NVIDIA-Software-Stack

Es gibt keine einzige Gewinner-Tabelle. Bei Stacks der 128GB-Klasse entscheiden Sie nach Software, Prefill-/Decode-Verhalten und Systemdesign. Überschreiten Sie die Kapazitätswand, und 192GB ist eine andere Klasse von Vorteil – keine höhere Benchmark-Zahl.

Zusammenfassung

Die Wahl unter diesen drei Deskside-Optionen hängt vom Szenario-Fit ab, nicht von einem einzelnen Gewinner:

  1. Kapazität ≠ Geschwindigkeit. 192 GB hilft, wenn Gewichte, KV-Cache oder Multi-Service-Stacks in 128 GB nicht passen – es erhöht die Tokens/s nicht automatisch.
  2. Prefill ≠ Decode. Im veröffentlichten GPT-OSS-120B-MXFP4-llama.cpp-Vergleichstest lag Sparks Prefill weit vorn, während Decode nah blieb – als Richtung lesen, nicht als Universalranking.
  3. 128GB-Klasse: NVIDIAs CUDA-/weniger-Reibungs-Pfad gegen AMDs x86-Strix-Desktop-Pfad (z. B. M1A PRO+ oder F9A-395), je nach Software-Stack und Bauform.
  4. 192GB-Klasse: Wenn der Working Set die Wand ist, bildet F9A-PRO495 den Max+ PRO 495 / 192GB LPDDR5X-8533 (Radeon 8065S) ab. „Gorgon“ bleibt hier der frühere Codename/die Käufer-Kurzform für diese Stufe.
  5. Kaufen Sie den Flaschenhals, den Sie wirklich haben: zuerst Fit, dann Bandbreite/Rechenleistung, dann CUDA- vs. ROCm-/llama.cpp-Reibung, dann Thermik und Erweiterung.

FAQ

Lohnt sich die NVIDIA-Box mit 128GB gegenüber der AMD-Option mit 128GB für lokale LLM-Inferenz?

Es kommt darauf an, was Sie kaufen. Im veröffentlichten GPT-OSS-120B-MXFP4-Vergleichstest oben lag Sparks Prefill weit vorn, während Decode nah dran war. Der Aufpreis kauft häufiger CUDA-Ökosystem, weniger Aufwand bei der Inbetriebnahme und DGX-orientierte Werkzeuge – keine universelle 5×-Generierungs-Behauptung. AMDs 128GB-Option bleibt für viele decode-lastige Windows-/x86-KI-Mini-PC-Setups wettbewerbsfähig.

Wie viel RAM brauche ich, um ein 70B-LLM lokal zu betreiben?

Planen Sie Gewichte + KV-Cache + Runtime + Extras, nicht nur das Parameter-Label. Viele Setups der 70B-Klasse sind in einem 128GB-Unified-Memory-Pool bei gängigen Quants komfortabel; langer Kontext, höhere Quants oder Multi-Service-Stacks erhöhen das Budget. Nutzen Sie die Planungstabelle oben – sie ist Orientierung, keine harte Grenze.

Kann ich 120B-Modelle auf 128GB Unified Memory betreiben?

Ja, mit starker Quantisierung und begrenzter Kontextlänge – aber Sie verlieren Spielraum für KV-Cache, Embedding-Modelle und Reranker. Dort schafft Hardware der Gorgon-Klasse mit 192GB Mehrwert. Fit bleibt das erste Tor; nutzbare Geschwindigkeit das zweite. Kapazitätsangaben zu 120B Q4 oder „bis 300B MoE“ sind Fit-Ziele (Quantisierung + Kontext + Runtime), keine Tokens/s-Zusage.

Ist 192GB besser als 128GB für lokale LLMs?

192 GB bieten mehr Modell- und KV-Cache-Spielraum, erhöhen Tokens/s aber nicht automatisch, wenn das Szenario bereits in 128 GB passt. Wählen Sie es für speicherbegrenzte Stacks (höhere Quants, Multi-Modell, langer Kontext, größere MoE-Gewichte) – nicht als kostenlosen Geschwindigkeitsvorteil.

Wann zählt die 192GB-Konfiguration mehr als jede der beiden 128GB-Boxen?

Wenn das Working Set nicht mehr passt: Multi-Modell-RAG, größere MoE-Gewichtsdateien, höhere Quants oder lange KV-Caches. Siehe auch die FAQ 192GB vs 128GB oben.

Bedeutet mehr Unified Memory schnellere Tokens/s?

Nein. Gewichte unterzubringen ist nicht dasselbe wie Tokens schnell zu erzeugen – Bandbreite, Rechenleistung, Quantisierung und Runtime setzen weiterhin das Tempo.

Sind NPU-TOPS ein guter Weg, On-Device-LLM-Hardware zu wählen?

Meist nein. Für Deskside-LLM-Inferenz dominieren GPU/APU + Speicher + Software die Inferenz-Ergebnisse stärker als NPU-TOPS-Folien.

Mini-PC oder Deskside-Workstation?

Chat und leichte Agenten passen oft in einen Mini-PC. Große Modelle, Multi-Service-RAG und lange Inferenzläufe neigen zur Workstation – inklusive einer kompakten Workstation wie dem F9A, wenn Sie Speicher der 192GB-Klasse brauchen.

Quellen

Vorheriger Beitrag
Nächster Beitrag

Hinterlassen Sie einen Kommentar

Bitte beachten Sie, dass Kommentare vor der Veröffentlichung genehmigt werden müssen.

Kaufen Sie den Look

Wählen Sie Optionen

ACEMAGIC DE
Neukunden erhalten 10 € Rabatt, jetzt anmelden!
Option bearbeiten

Wählen Sie Optionen

this is just a warning
Warenkorb
0 Artikel