Created bymario-alka.dePowered bygodcore.denoob2claw.detricoma.de
Mistral AI

Devstral-Small-2-24B-Instruct-2512

Harnessbenchmark · gemessen am 17.07.2026 09:28

Benchmark-IDrun-20260722-161611-23baf9
Tool Usage Extrem 40 - Tech-Radar Mission 1.0Dense24BRuntime: godclawQuantisierung: Q8_0
Zur Einordnung: Diese Plattform nutzt Unified Memory – die "VRAM" ist gemeinsamer System-RAM (APU/Superchip); das Modell teilt sich den Speicher mit dem System.
Punkte5.629,00von 8.210,00
Punktequote68,56%
Aufgaben bestanden40von 40
Gesamtdauer2.018,00s
Einordnung im Feld
11von 30 Systemen

Harnessbenchmark · Leitmetrik: Punktequote (%)

Dieser Lauf ist besser als 66 % aller vergleichbaren Systeme.
Punktequote 69 %
+26 % vs Ø 54,4
Aufgaben bestanden 40
+115 % vs Ø 18,6
Gesamtdauer 2.018,0 s
-16 % vs Ø 2.395,9
Verteilung im Feld10 – 91 %
Ø 54 Median Dieser Lauf

Wie schlägt sich dieser Benchmark?

Hardware

GPU: AMD GPU
CPU: 32x AMD RYZEN AI MAX+ 395 w/ Radeon 8060S
RAM: 31 GB
Mainboard: Meigao Innovation Technology (Shen Zhen) Co., Ltd SHWSA (MS-S1 MAX)

Setup

Runtime: godclaw
Quantisierung: Q8_0
Betriebssystem: Ubuntu 24.04.2 LTS (Kernel 6.17.0-40-generic)
Treiber: ROCm 7.2.0
Modell: Devstral-Small-2-24B-Instruct-2512

Aufgaben (40)

AufgabeStatusPunkteDauer
Antwortzeitbestanden5 / 5028,00 s
Strukturierte Ausgabebestanden7 / 7037,00 s
Arbeitsverzeichnis anlegenbestanden10 / 10099,00 s
Quelldatei schreibenbestanden12 / 120308,00 s
Gezielt lesenbestanden72 / 10011,00 s
Zählen im Dateisystembestanden99 / 13012,00 s
CSV erzeugenbestanden80 / 18043,00 s
CSV nach JSONbestanden70 / 22068,00 s
Defektes JSON diagnostizierenbestanden60 / 18052,00 s
Datenfilterbestanden185 / 22016,00 s
Prüfsummenbestanden131 / 18021,00 s
Archiv packenbestanden161 / 1808,00 s
Internetrecherche Faktbestanden172 / 22022,00 s
Internetrecherche Vergleichbestanden217 / 25016,00 s
Webseite auswertenbestanden176 / 22022,00 s
Rechercheergebnis sichernbestanden36 / 20073,00 s
Wissenseintrag anlegenbestanden183 / 30052,00 s
Wissenseintrag wiederfindenbestanden115 / 20038,00 s
Wissenseintrag erweiternbestanden228 / 25010,00 s
Versionierung prüfenbestanden191 / 22013,00 s
Kategorien erkundenbestanden148 / 18014,00 s
Aufgabenboards sichtenbestanden178 / 20010,00 s
Aufgabe erstellenbestanden239 / 2505,00 s
Aufgabenliste anlegenbestanden219 / 25014,00 s
Aufgabenliste prüfenbestanden141 / 18017,00 s
Organisation erfassenbestanden214 / 25016,00 s
Fakt hinterlegenbestanden232 / 2508,00 s
Verknüpfung herstellenbestanden236 / 28019,00 s
Bestand durchsuchenbestanden198 / 22010,00 s
Erkenntnis merkenbestanden171 / 20013,00 s
Erkenntnis abrufenbestanden159 / 1809,00 s
Titelbild erzeugenbestanden222 / 25015,00 s
Zweitmeinung einholenbestanden25 / 250465,00 s
Kette: Recherche in Dateibestanden185 / 25029,00 s
Kette: Datei ins Wissenbestanden255 / 28012,00 s
Konsistenzprüfungbestanden198 / 25023,00 s
Fehlerfall ehrlich meldenbestanden185 / 2006,00 s
Abschlussberichtbestanden28 / 280148,00 s
Gezielt aufräumenbestanden22 / 220220,00 s
Selbstauskunftbestanden164 / 20016,00 s

Konfiguration

benchmark-konfiguration — run-20260722-161611-23baf9
# LLM-Benchmark Konfiguration # Modell : Devstral-Small-2-24B-Instruct-2512 # Engine : llama.cpp # Run-ID : run-20260722-161611-23baf9 # GPU : AMD GPU # CPU : 32x AMD RYZEN AI MAX+ 395 w/ Radeon 8060S # RAM : 31 GB bench@llm-benchmark:~$ /home/godcore/llama.cpp/build-rocm/bin/llama-server \ --model /home/godcore/models/devstral-small-2-24b-q8_0-gguf/Devstral-Small-2-24B-Instruct-2512-Q8_0.gguf \ --alias mistralai/Devstral-Small-2-24B-Instruct-2512 \ --host 0.0.0.0 \ --port 8000 \ --ctx-size 131072 \ --parallel 1 \ --temp 0.2 \ --repeat-penalty 1.05 \ --repeat-last-n 256 \ --gpu-layers 99 \ --flash-attn on \ --jinja \ --chat-template-file /home/godcore/models/devstral-small-2-24b-q8_0-gguf/chat_template.jinja \ --threads 8 \ --threads-batch 16
Engine?Die Inferenz-Software, die das Modell ausliefert (z.B. vLLM oder llama.cpp). Sie bestimmt Geschwindigkeit, unterstuetzte Modellformate und welche Parameter ueberhaupt verfuegbar sind.llamacpp
Modellalias?Der Name, unter dem das Modell ueber die API angesprochen wird. Genau dieser Wert muss im Request-Feld 'model' stehen.mistralai/Devstral-Small-2-24B-Instruct-2512
Kontextlaenge?Maximale Anzahl Tokens (Eingabe + erzeugte Ausgabe zusammen), die das Modell pro Anfrage verarbeiten kann.131072
Modellpfad?Pfad zur GGUF-Modelldatei, die geladen und ausgeliefert wird./home/godcore/models/devstral-small-2-24b-q8_0-gguf/Devstral-Small-2-24B-Instruct-2512-Q8_0.gguf
Parallel?Anzahl paralleler Slots/Sequenzen, die der Server gleichzeitig bedient. Der Kontext wird auf die Slots aufgeteilt.1
Temperatur?Sampling-Temperatur. Hoeher = kreativer/zufaelliger, niedriger = deterministischer. 0 = greedy.0.2
Repeat-Penalty?Straffaktor gegen Token-Wiederholungen. 1.0 = keine Strafe, hoeher = staerker.1.05
Repeat-Last-N?Anzahl der letzten Token, die fuer die Wiederholungsstrafe betrachtet werden. 0 = aus, -1 = gesamter Kontext.256
GPU-Layer?Anzahl der auf die GPU ausgelagerten Modell-Layer. Hoeher = mehr VRAM und schneller; der Rest laeuft auf der CPU. 999 = alles auf GPU.99
Flash Attention?FlashAttention fuer schnellere und speichersparende Attention. Wert on/off/auto je nach Build.on
Jinja?Nutzt die im Modell eingebettete Jinja-Chat-Vorlage fuer korrekte Rollen-, Tool- und Reasoning-Formatierung.aktiv
Chat-Template?Pfad zu einer externen Chat-Template-Datei. Ueberschreibt die im Modell eingebettete Vorlage./home/godcore/models/devstral-small-2-24b-q8_0-gguf/chat_template.jinja
Threads?Anzahl CPU-Threads fuer die Token-Generierung (Decode).8
Batch-Threads?Anzahl CPU-Threads fuer Prompt-Verarbeitung und Batch (Prefill).16

Alle Benchmarks dieses Modells Zum Leaderboard

Modell-Vergleich

Devstral-Small-2-24B-Instruct-2512 auf verschiedener Hardware

Alle veroeffentlichten Performance-Läufe dieses Modells – jede Blase eine Variante: Position = Prefill (X) × Generation (Y), Blasengröße = Anzahl Läufe. Näher oben rechts = schneller. ★ Gold markiert = dieser Benchmark.

GPUnach Grafikkarte

36,427,719,110,51,905691.1391.708Prefill (tok/s)Generation (tok/s)AMD Radeon AI PRO R9700 - 29,4 tok/s Generation, 1.380 tok/s Prefill, TTFT 2.259 ms (3 Laufe)AMD Radeon AI PRO R97...AMD Radeon 8060S Graphics - 8,9 tok/s Generation, 22 tok/s Prefill, TTFT 906 ms (1 Lauf)AMD Radeon 8060S Grap...
AMD Radeon AI PRO R9700 29,4 tok/sAMD Radeon 8060S Graphics 8,9 tok/s

CPUnach Prozessor

36,427,719,110,51,905691.1391.708Prefill (tok/s)Generation (tok/s)AMD Ryzen Threadripper PRO 7955WX 16-Cores - 29,4 tok/s Generation, 1.380 tok/s Prefill, TTFT 2.259 ms (3 Laufe)AMD Ryzen Threadrippe...AMD RYZEN AI MAX+ 395 w/ Radeon 8060S - 8,9 tok/s Generation, 22 tok/s Prefill, TTFT 906 ms (1 Lauf) | DIESER LAUF★ AMD RYZEN AI MAX+ 395...
AMD Ryzen Threadripper PRO 7955WX 16-Cores 29,4 tok/s★ AMD RYZEN AI MAX+ 395 w/ Radeon 8060S 8,9 tok/s dieser Lauf

MBnach Mainboard

36,427,719,110,51,905691.1391.708Prefill (tok/s)Generation (tok/s)ASUSTeK COMPUTER INC. Pro WS WRX90E-SAGE SE - 29,4 tok/s Generation, 1.380 tok/s Prefill, TTFT 2.259 ms (3 Laufe)ASUSTeK COMPUTER INC....Meigao Innovation Technology (Shen Zhen) Co., Ltd SHWSA (MS-S1 MAX) - 8,9 tok/s Generation, 22 tok/s Prefill, TTFT 906 ms (1 Lauf) | DIESER LAUF★ Meigao Innovation Tec...
ASUSTeK COMPUTER INC. Pro WS WRX90E-SAGE SE 29,4 tok/s★ Meigao Innovation Technology (Shen Zhen) Co., Ltd SHWSA (MS-S1 MAX) 8,9 tok/s dieser Lauf

ENGnach Engine

32,330,829,427,926,49781.0201.0621.103Prefill (tok/s)Generation (tok/s)llama.cpp - 29,4 tok/s Generation, 1.041 tok/s Prefill, TTFT 1.921 ms (4 Laufe) | DIESER LAUF★ llama.cpp
★ llama.cpp 29,4 tok/s dieser Lauf

DRVnach Treiber

36,427,719,110,51,905691.1391.708Prefill (tok/s)Generation (tok/s)AMD 7.0.0-27-generic - 29,4 tok/s Generation, 1.380 tok/s Prefill, TTFT 2.259 ms (3 Laufe)AMD 7.0.0-27-genericROCm 7.2.0 - 8,9 tok/s Generation, 22 tok/s Prefill, TTFT 906 ms (1 Lauf) | DIESER LAUF★ ROCm 7.2.0
AMD 7.0.0-27-generic 29,4 tok/s★ ROCm 7.2.0 8,9 tok/s dieser Lauf