Mistral AI
Devstral-Small-2-24B-Instruct-2512
Harnessbenchmark · gemessen am 17.07.2026 13:33
Benchmark-ID
run-20260722-161611-798dccGodBrain MCP Deep 40 - Wissensbasis-Lebenszyklus 1.0Dense24BRuntime: godclawQuantisierung: Q8_0
Punkte5.738,00von 7.580,00
Punktequote75,70%
Aufgaben bestanden40von 40
Gesamtdauer1.879,00s
Einordnung im Feld
8von 30 Systemen
Harnessbenchmark · Leitmetrik: Punktequote (%)
Dieser Lauf ist besser als 76 % aller vergleichbaren Systeme.
Punktequote
76 %
+39 % vs Ø 54,4
Aufgaben bestanden
40
+115 % vs Ø 18,6
Gesamtdauer
1.879,0 s
-22 % vs Ø 2.395,9
Verteilung im Feld10 – 91 %
Wie schlägt sich dieser Benchmark?
Gemma-4-26B-A4B-itNVIDIA RTX PRO 6000 Blackwell Max-Q Workstation Edition · run-20260722-161611-05d866
91 %
Devstral-Small-2-24B-Instruct-2512 gleiches ModellAMD GPU · run-20260722-161611-5f2f86
87 %
Gemma-4-26B-A4B-itAMD GPU · run-20260722-161611-12a767
82 %
MiniMax-M2.53× NVIDIA RTX PRO 6000 Blackwell Max-Q Workstation Edition · run-20260722-161611-f6cfe1
81 %
Gemma-4-26B-A4B-itAMD GPU · run-20260722-161611-9b7325
80 %
MiniMax-M2.53× NVIDIA RTX PRO 6000 Blackwell Max-Q Workstation Edition · run-20260722-161611-54019f
79 %
Gemma-4-26B-A4B-itAMD GPU · run-20260722-161611-0064a9
76 %
Devstral-Small-2-24B-Instruct-2512 dieser LaufAMD GPU · run-20260722-161611-798dcc
76 %
Gemma-4-26B-A4B-itAMD GPU · run-20260722-161611-78ff78
74 %
MiniMax-M2.5-BF16-INT4-AWQNVIDIA GB10 · run-20260722-165444-51f2b3
71 %
Devstral-Small-2-24B-Instruct-2512 gleiches ModellAMD GPU · run-20260722-161611-23baf9
69 %
MiniMax-M2.53× NVIDIA RTX PRO 6000 Blackwell Max-Q Workstation Edition · run-20260722-161611-a58abe
68 %
MiniMax-M2.53× NVIDIA RTX PRO 6000 Blackwell Max-Q Workstation Edition · run-20260722-161611-2a2c91
65 %
MiniMax-M2.53× NVIDIA RTX PRO 6000 Blackwell Max-Q Workstation Edition · run-20260722-161610-99f36d
61 %
Hardware
GPU: AMD GPU · 0 GB VRAM
CPU: 32x AMD RYZEN AI MAX+ 395 w/ Radeon 8060S
RAM: 31 GB
Setup
Runtime: godclaw
Quantisierung: Q8_0
Modell: Devstral-Small-2-24B-Instruct-2512
Aufgaben (40)
| Aufgabe | Status | Punkte | Dauer |
|---|---|---|---|
| Entitätstypen erkunden | bestanden | 84 / 120 | 15,00 s |
| Rohdatentypen erkunden | bestanden | 79 / 120 | 17,00 s |
| Wissenskategorien auflisten | bestanden | 67 / 120 | 22,00 s |
| Aufgabenboards sichten | bestanden | 53 / 130 | 33,00 s |
| Freitextsuche im Bestand | bestanden | 85 / 150 | 29,00 s |
| Firma anlegen | bestanden | 159 / 200 | 16,00 s |
| Firma wiederfinden | bestanden | 118 / 150 | 13,00 s |
| Firma aktualisieren | bestanden | 161 / 200 | 15,00 s |
| Person anlegen | bestanden | 167 / 180 | 5,00 s |
| Person wiederfinden | bestanden | 118 / 150 | 12,00 s |
| Rolle verknüpfen | bestanden | 198 / 220 | 9,00 s |
| Rolle ändern | bestanden | 177 / 200 | 9,00 s |
| Fakt hinterlegen | bestanden | 154 / 200 | 18,00 s |
| Fakt wiederfinden | bestanden | 116 / 150 | 14,00 s |
| Fakt bestätigen | bestanden | 174 / 200 | 10,00 s |
| Beziehung herstellen | bestanden | 200 / 220 | 8,00 s |
| Beziehung ändern | bestanden | 158 / 180 | 9,00 s |
| Wissenskategorie anlegen | bestanden | 155 / 180 | 10,00 s |
| Wissenseintrag anlegen | bestanden | 195 / 250 | 22,00 s |
| Wissenseintrag suchen | bestanden | 121 / 150 | 12,00 s |
| Wissenseintrag per ID lesen | bestanden | 130 / 150 | 8,00 s |
| Wissenseintrag erweitern | bestanden | 177 / 200 | 9,00 s |
| Versionsstände prüfen | bestanden | 228 / 250 | 9,00 s |
| Board-Struktur verstehen | bestanden | 95 / 180 | 34,00 s |
| Kachel anlegen | bestanden | 180 / 220 | 16,00 s |
| Aufgabe anlegen | bestanden | 200 / 220 | 8,00 s |
| Aufgabe ändern und prüfen | bestanden | 203 / 220 | 7,00 s |
| ToDo-Liste anlegen | bestanden | 155 / 180 | 10,00 s |
| ToDo-Punkte anlegen | bestanden | 115 / 200 | 33,00 s |
| ToDo-Punkt abhaken | bestanden | 159 / 200 | 16,00 s |
| Rohdatensatz anlegen | bestanden | 136 / 200 | 25,00 s |
| Rohdaten-Status setzen | bestanden | 151 / 200 | 19,00 s |
| Notizen sichten | bestanden | 118 / 150 | 13,00 s |
| Mail-Integrationen sichten | bestanden | 138 / 150 | 5,00 s |
| Aufräumen: Beziehung + Fakt | bestanden | 203 / 220 | 7,00 s |
| Aufräumen: Rolle + Person | bestanden | 205 / 220 | 6,00 s |
| Aufräumen: Firma | bestanden | 177 / 200 | 9,00 s |
| Aufräumen: Wissenseintrag | bestanden | 174 / 200 | 10,00 s |
| Aufräumen: Kanban + ToDo | bestanden | 25 / 250 | 659,00 s |
| Endkontrolle Rückstandsfreiheit | bestanden | 30 / 300 | 678,00 s |
Konfiguration
# LLM-Benchmark Konfiguration
# Modell : Devstral-Small-2-24B-Instruct-2512
# Engine : llama.cpp
# Run-ID : run-20260722-161611-798dcc
# GPU : AMD GPU
# CPU : 32x AMD RYZEN AI MAX+ 395 w/ Radeon 8060S
# RAM : 31 GB
bench@llm-benchmark:~$ /home/godcore/llama.cpp/build-rocm/bin/llama-server \
--model /home/godcore/models/devstral-small-2-24b-q8_0-gguf/Devstral-Small-2-24B-Instruct-2512-Q8_0.gguf \
--alias mistralai/Devstral-Small-2-24B-Instruct-2512 \
--host 0.0.0.0 \
--port 8000 \
--ctx-size 131072 \
--parallel 1 \
--temp 0.2 \
--repeat-penalty 1.05 \
--repeat-last-n 256 \
--gpu-layers 99 \
--flash-attn on \
--jinja \
--chat-template-file /home/godcore/models/devstral-small-2-24b-q8_0-gguf/chat_template.jinja \
--threads 8 \
--threads-batch 16
| Engine | llamacpp |
| Modellalias | mistralai/Devstral-Small-2-24B-Instruct-2512 |
| Kontextlaenge | 131072 |
| Modellpfad | /home/godcore/models/devstral-small-2-24b-q8_0-gguf/Devstral-Small-2-24B-Instruct-2512-Q8_0.gguf |
| Parallel | 1 |
| Temperatur | 0.2 |
| Repeat-Penalty | 1.05 |
| Repeat-Last-N | 256 |
| GPU-Layer | 99 |
| Flash Attention | on |
| Jinja | aktiv |
| Chat-Template | /home/godcore/models/devstral-small-2-24b-q8_0-gguf/chat_template.jinja |
| Threads | 8 |
| Batch-Threads | 16 |
