Nemotron-Cascade-2-30B-A3B
Performancebenchmark · measured on 23.07.2026 00:55
run-20260723-015520-d2cd35Performancebenchmark · Leitmetrik: Generation-Speed (tok/s)
Wie schlägt sich dieser Benchmark?
Hardware
GPU: Keine GPU (CPU-only)
CPU: 51x Intel(R) Xeon(R) CPU E5-4620 v2 @ 2.60GHz
RAM: 504 GB
Mainboard: Dell Inc. PowerEdge R820
Setup
Runtime: llama.cpp
Quantization: Q4_K_M
Operating system: Ubuntu 24.04.3 LTS (Kernel 7.0.0-28-generic)
Model: Nemotron-Cascade-2-30B-A3B
Configuration
| Engine?Die Inferenz-Software, die das Modell ausliefert (z.B. vLLM oder llama.cpp). Sie bestimmt Geschwindigkeit, unterstuetzte Modellformate und welche Parameter ueberhaupt verfuegbar sind. | llamacpp |
| Kontextlaenge?Maximale Anzahl Tokens (Eingabe + erzeugte Ausgabe zusammen), die das Modell pro Anfrage verarbeiten kann. | 8192 |
| Modellpfad?Pfad zur GGUF-Modelldatei, die geladen und ausgeliefert wird. | /opt/models/Meta-Llama-3.1-8B-Instruct-Q4_K_M.gguf |
| NUMA?NUMA-Optimierung fuer Multi-Socket-CPUs: distribute/isolate/numactl. Verbessert die Speicherlokalitaet. | distribute |
| Threads?Anzahl CPU-Threads fuer die Token-Generierung (Decode). | 64 |
| Batch-Threads?Anzahl CPU-Threads fuer Prompt-Verarbeitung und Batch (Prefill). | 64 |
| Kontext?Groesse des Kontextfensters in Token. 0 = der beim Training verwendete Kontext des Modells. | 8192 |
Nemotron-Cascade-2-30B-A3B auf verschiedener Hardware
Alle veroeffentlichten Performance-Läufe dieses Modells – jede Blase eine Variante: Position = Prefill (X) × Generation (Y), Blasengröße = Anzahl Läufe. Näher oben rechts = schneller. ★ Gold markiert = dieser Benchmark.
GPUnach Grafikkarte
CPUnach Prozessor
MBnach Mainboard
ENGnach Engine
DRVnach Treiber
Mario Alka Administrator
Gruender von godcore.de und Betreiber von llm-benchmark.de. Ich teste KI-Sprachmodelle auf echter Hardware, messe Tempo (Token/s) und Aufgaben-Qualitaet und teile die Ergebnisse offen und reproduzierbar.
