Created bymario-alka.dePowered bygodcore.denoob2claw.detricoma.de
Qwen (Alibaba)

Qwen2.5-Coder-32B-Instruct

Performancebenchmark · gemessen am 21.07.2026 10:28

Benchmark-IDrun-20260722-165906-559257
Timebench 3 - Kombi (Prefill + Generation)Dense32BRuntime: llama.cpp
Konfigurations-Hinweis: Es sind 3 Grafikkarten installiert, aber nur 2 wurden fuer diesen Lauf genutzt. Mit allen 3 GPUs koennte der Durchsatz deutlich hoeher liegen.
Generation19,14tok/s
Prefill1.274,28tok/s
Time to First Token1.705,00ms
Gesamtdauer54,84s
Concurrency1parallel
Einordnung im Feld
237von 320 Systemen

Performancebenchmark · Leitmetrik: Generation-Speed (tok/s)

Dieser Lauf ist besser als 26 % aller vergleichbaren Systeme.
Generation 19,1 tok/s
-79 % vs Ø 89,4
Prefill 1.274,3 tok/s
-60 % vs Ø 3.182,6
Time to First Token 1.705 ms
-92 % vs Ø 21.684
Verteilung im Feld0 – 1.295 tok/s
Ø 89 Median Dieser Lauf

Wie schlägt sich dieser Benchmark?

Hardware

GPU: 3x AMD Radeon AI PRO R9700 · 32 GB VRAM
CPU: 32x AMD Ryzen Threadripper PRO 7955WX 16-Cores
RAM: 184 GB
Mainboard: ASUSTeK COMPUTER INC. Pro WS WRX90E-SAGE SE

Setup

Runtime: llama.cpp
Quantisierung: -
Betriebssystem: Ubuntu 26.04 LTS (Kernel 7.0.0-27-generic)
Treiber: AMD 7.0.0-27-generic
Modell: Qwen2.5-Coder-32B-Instruct

Konfiguration

benchmark-konfiguration — run-20260722-165906-559257
# LLM-Benchmark Konfiguration # Modell : Qwen2.5-Coder-32B-Instruct # Engine : llama.cpp # Run-ID : run-20260722-165906-559257 # GPU : 3x AMD Radeon AI PRO R9700 # CPU : 32x AMD Ryzen Threadripper PRO 7955WX 16-Cores # RAM : 184 GB bench@llm-benchmark:~$ llama-server \ --model gfx1201/ROCm \ -m gfx1201/ROCm \ -ngl 999 \ -c 8192 \ -a Qwen2.5-Coder-32B-Instruct \ --host 0.0.0.0 \ --port 8000 \ -sm layer
Engine?Die Inferenz-Software, die das Modell ausliefert (z.B. vLLM oder llama.cpp). Sie bestimmt Geschwindigkeit, unterstuetzte Modellformate und welche Parameter ueberhaupt verfuegbar sind.llamacpp
Modellalias?Der Name, unter dem das Modell ueber die API angesprochen wird. Genau dieser Wert muss im Request-Feld 'model' stehen.Qwen2.5-Coder-32B-Instruct
Kontextlaenge?Maximale Anzahl Tokens (Eingabe + erzeugte Ausgabe zusammen), die das Modell pro Anfrage verarbeiten kann.8192
Modellpfad?Pfad zur GGUF-Modelldatei, die geladen und ausgeliefert wird.gfx1201/ROCm
GPU-Layer?Anzahl der auf die GPU ausgelagerten Modell-Layer. Hoeher = mehr VRAM und schneller; der Rest laeuft auf der CPU. 999 = alles auf GPU.999
Kontext?Groesse des Kontextfensters in Token. 0 = der beim Training verwendete Kontext des Modells.8192
Alias?Anzeigename des Modells nach aussen (served model name), unabhaengig vom Dateinamen.Qwen2.5-Coder-32B-Instruct
Split-Mode?Verteilung ueber mehrere GPUs: none (nur eine GPU), layer (Layer aufteilen) oder row (Tensoren zeilenweise).layer

Alle Benchmarks dieses Modells Zum Leaderboard

Modell-Vergleich

Qwen2.5-Coder-32B-Instruct auf verschiedener Hardware

Alle veroeffentlichten Performance-Läufe dieses Modells – jede Blase eine Variante: Position = Prefill (X) × Generation (Y), Blasengröße = Anzahl Läufe. Näher oben rechts = schneller. ★ Gold markiert = dieser Benchmark.

GPUnach Grafikkarte

78,060,041,923,95,801.3262.6523.978Prefill (tok/s)Generation (tok/s)AMD Radeon 8060S Graphics - 20,6 tok/s Generation, 518 tok/s Prefill, TTFT 24.112 ms (3 Laufe)AMD Radeon 8060S Grap...AMD Radeon AI PRO R9700 - 63,2 tok/s Generation, 3.283 tok/s Prefill, TTFT 2.374 ms (14 Laufe) | DIESER LAUF★ AMD Radeon AI PRO R97...
★ AMD Radeon AI PRO R9700 63,2 tok/s dieser LaufAMD Radeon 8060S Graphics 20,6 tok/s

CPUnach Prozessor

78,060,041,923,95,801.3262.6523.978Prefill (tok/s)Generation (tok/s)AMD RYZEN AI MAX+ 395 w/ Radeon 8060S - 20,6 tok/s Generation, 518 tok/s Prefill, TTFT 24.112 ms (3 Laufe)AMD RYZEN AI MAX+ 395...AMD Ryzen Threadripper PRO 7955WX 16-Cores - 63,2 tok/s Generation, 3.283 tok/s Prefill, TTFT 2.374 ms (14 Laufe) | DIESER LAUF★ AMD Ryzen Threadrippe...
★ AMD Ryzen Threadripper PRO 7955WX 16-Cores 63,2 tok/s dieser LaufAMD RYZEN AI MAX+ 395 w/ Radeon 8060S 20,6 tok/s

MBnach Mainboard

78,060,041,923,95,801.3262.6523.978Prefill (tok/s)Generation (tok/s)Meigao Innovation Technology (Shen Zhen) Co., Ltd SHWSA (MS-S1 MAX) - 20,6 tok/s Generation, 518 tok/s Prefill, TTFT 24.112 ms (3 Laufe)Meigao Innovation Tec...ASUSTeK COMPUTER INC. Pro WS WRX90E-SAGE SE - 63,2 tok/s Generation, 3.283 tok/s Prefill, TTFT 2.374 ms (14 Laufe) | DIESER LAUF★ ASUSTeK COMPUTER INC....
★ ASUSTeK COMPUTER INC. Pro WS WRX90E-SAGE SE 63,2 tok/s dieser LaufMeigao Innovation Technology (Shen Zhen) Co., Ltd SHWSA (MS-S1 MAX) 20,6 tok/s

ENGnach Engine

80,260,140,120,00,002.1674.3346.501Prefill (tok/s)Generation (tok/s)unbekannt - 20,6 tok/s Generation, 518 tok/s Prefill, TTFT 24.112 ms (3 Laufe)unbekanntvLLM - 9,9 tok/s Generation, 5.318 tok/s Prefill, TTFT 472 ms (6 Laufe)vLLMllama.cpp - 63,2 tok/s Generation, 1.757 tok/s Prefill, TTFT 3.800 ms (8 Laufe) | DIESER LAUF★ llama.cpp
★ llama.cpp 63,2 tok/s dieser Laufunbekannt 20,6 tok/svLLM 9,9 tok/s

DRVnach Treiber

78,060,041,923,95,801.3262.6523.978Prefill (tok/s)Generation (tok/s)ROCm 7.2.0 - 20,6 tok/s Generation, 518 tok/s Prefill, TTFT 24.112 ms (3 Laufe)ROCm 7.2.0AMD 7.0.0-27-generic - 63,2 tok/s Generation, 3.283 tok/s Prefill, TTFT 2.374 ms (14 Laufe) | DIESER LAUF★ AMD 7.0.0-27-generic
★ AMD 7.0.0-27-generic 63,2 tok/s dieser LaufROCm 7.2.0 20,6 tok/s