Llama-3_3-Nemotron-Super-49B-v1_5
Performancebenchmark · measured on 23.07.2026 18:53
run-20260723-194447-466598Performancebenchmark · Leitmetrik: Generation-Speed (tok/s)
Wie schlägt sich dieser Benchmark?
Hardware
GPU: AMD Radeon 8060S Graphics
CPU: 32x AMD RYZEN AI MAX+ 395 w/ Radeon 8060S
RAM: 31 GB
Mainboard: Meigao Innovation Technology (Shen Zhen) Co., Ltd SHWSA (MS-S1 MAX)
Setup
Runtime: llama.cpp
Quantization: Q4_K_M
Operating system: Ubuntu 24.04.2 LTS (Kernel 6.17.0-40-generic)
Driver: ROCm 7.2.0
Model: Llama-3_3-Nemotron-Super-49B-v1_5
Configuration
| Engine?Die Inferenz-Software, die das Modell ausliefert (z.B. vLLM oder llama.cpp). Sie bestimmt Geschwindigkeit, unterstuetzte Modellformate und welche Parameter ueberhaupt verfuegbar sind. | llamacpp |
| Modellalias?Der Name, unter dem das Modell ueber die API angesprochen wird. Genau dieser Wert muss im Request-Feld 'model' stehen. | Llama-3_3-Nemotron-Super-49B-v1_5 |
| Kontextlaenge?Maximale Anzahl Tokens (Eingabe + erzeugte Ausgabe zusammen), die das Modell pro Anfrage verarbeiten kann. | 26624 |
| Modellpfad?Pfad zur GGUF-Modelldatei, die geladen und ausgeliefert wird. | bartowski/nvidia_Llama-3_3-Nemotron-Super-49B-v1-GGUF/Q4_K_M.gguf |
| Alias?Anzeigename des Modells nach aussen (served model name), unabhaengig vom Dateinamen. | Llama-3_3-Nemotron-Super-49B-v1_5 |
| GPU-Layer?Anzahl der auf die GPU ausgelagerten Modell-Layer. Hoeher = mehr VRAM und schneller; der Rest laeuft auf der CPU. 999 = alles auf GPU. | 99 |
| Flash Attention?FlashAttention fuer schnellere und speichersparende Attention. Wert on/off/auto je nach Build. | on |
| Kontext?Groesse des Kontextfensters in Token. 0 = der beim Training verwendete Kontext des Modells. | 26624 |
| Parallel?Anzahl paralleler Slots/Sequenzen, die der Server gleichzeitig bedient. Der Kontext wird auf die Slots aufgeteilt. | 12 |
Llama-3_3-Nemotron-Super-49B-v1_5 auf verschiedener Hardware
Alle veroeffentlichten Performance-Läufe dieses Modells – jede Blase eine Variante: Position = Prefill (X) × Generation (Y), Blasengröße = Anzahl Läufe. Näher oben rechts = schneller. ★ Gold markiert = dieser Benchmark.
GPUnach Grafikkarte
CPUnach Prozessor
MBnach Mainboard
ENGnach Engine
DRVnach Treiber
Mario Alka Administrator
Gruender von godcore.de und Betreiber von llm-benchmark.de. Ich teste KI-Sprachmodelle auf echter Hardware, messe Tempo (Token/s) und Aufgaben-Qualitaet und teile die Ergebnisse offen und reproduzierbar.
