MiniMax
MiniMax-M2.5
Harnessbenchmark · gemessen am 19.07.2026 22:44
Benchmark-ID
run-20260722-161612-8d5f5cTool-Parcours Dossier 40 V1.0MoE230BRuntime: godclawQuantisierung: BF16
Punkte3.622,00von 5.960,00
Punktequote60,77%
Aufgaben bestanden34von 40
Gesamtdauer7.862,00s
Einordnung im Feld
16von 30 Systemen
Harnessbenchmark · Leitmetrik: Punktequote (%)
Dieser Lauf ist besser als 48 % aller vergleichbaren Systeme.
Punktequote
61 %
+12 % vs Ø 54,4
Aufgaben bestanden
34
+83 % vs Ø 18,6
Gesamtdauer
7.862,0 s
+228 % vs Ø 2.395,9
Verteilung im Feld10 – 91 %
Wie schlägt sich dieser Benchmark?
Gemma-4-26B-A4B-itNVIDIA RTX PRO 6000 Blackwell Max-Q Workstation Edition · run-20260722-161611-05d866
91 %
Devstral-Small-2-24B-Instruct-2512AMD GPU · run-20260722-161611-5f2f86
87 %
Gemma-4-26B-A4B-itAMD GPU · run-20260722-161611-12a767
82 %
MiniMax-M2.5 gleiches Modell3× NVIDIA RTX PRO 6000 Blackwell Max-Q Workstation Edition · run-20260722-161611-f6cfe1
81 %
Gemma-4-26B-A4B-itAMD GPU · run-20260722-161611-9b7325
80 %
MiniMax-M2.5 gleiches Modell3× NVIDIA RTX PRO 6000 Blackwell Max-Q Workstation Edition · run-20260722-161611-54019f
79 %
Gemma-4-26B-A4B-itAMD GPU · run-20260722-161611-0064a9
76 %
Devstral-Small-2-24B-Instruct-2512AMD GPU · run-20260722-161611-798dcc
76 %
Gemma-4-26B-A4B-itAMD GPU · run-20260722-161611-78ff78
74 %
MiniMax-M2.5-BF16-INT4-AWQNVIDIA GB10 · run-20260722-165444-51f2b3
71 %
Devstral-Small-2-24B-Instruct-2512AMD GPU · run-20260722-161611-23baf9
69 %
MiniMax-M2.5 gleiches Modell3× NVIDIA RTX PRO 6000 Blackwell Max-Q Workstation Edition · run-20260722-161611-a58abe
68 %
MiniMax-M2.5 gleiches Modell3× NVIDIA RTX PRO 6000 Blackwell Max-Q Workstation Edition · run-20260722-161611-2a2c91
65 %
MiniMax-M2.5 gleiches Modell3× NVIDIA RTX PRO 6000 Blackwell Max-Q Workstation Edition · run-20260722-161610-99f36d
61 %
MiniMax-M2.5 dieser Lauf3× NVIDIA RTX PRO 6000 Blackwell Max-Q Workstation Edition · run-20260722-161612-8d5f5c
61 %
Hardware
GPU: 3x NVIDIA RTX PRO 6000 Blackwell Max-Q Workstation Edition · 96 GB VRAM
CPU: 34x AMD Ryzen Threadripper PRO 9965WX 24-Cores
RAM: 125 GB
Setup
Runtime: godclaw
Quantisierung: BF16
Modell: MiniMax-M2.5
Aufgaben (40)
| Aufgabe | Status | Punkte | Dauer |
|---|---|---|---|
| Arbeitsstruktur anlegen | bestanden | 5 / 50 | 7.214,00 s |
| Startdatei schreiben | bestanden | 9 / 60 | 19,00 s |
| Datei zuruecklesen | bestanden | 38 / 50 | 4,00 s |
| CSV mit Testdaten | bestanden | 46 / 80 | 14,00 s |
| Struktur pruefen | fehlgeschlagen | 0 / 60 | 69,00 s |
| Recherche RAG | bestanden | 92 / 150 | 26,00 s |
| Recherche Hersteller | bestanden | 94 / 120 | 11,00 s |
| Recherche sichern | bestanden | 55 / 100 | 15,00 s |
| Webseite auswerten | bestanden | 60 / 140 | 38,00 s |
| Seite im Browser oeffnen | bestanden | 164 / 180 | 9,00 s |
| Modellvergleich | bestanden | 150 / 200 | 21,00 s |
| Quellenliste | bestanden | 66 / 90 | 9,00 s |
| Wissenskategorien sichten | bestanden | 82 / 100 | 6,00 s |
| Wissenseintrag anlegen | bestanden | 186 / 220 | 13,00 s |
| Wissenseintrag pruefen | bestanden | 104 / 120 | 6,00 s |
| Wissenseintrag ergaenzen | bestanden | 170 / 200 | 10,00 s |
| Versionen zaehlen | bestanden | 126 / 140 | 5,00 s |
| Wissen durchsuchen | bestanden | 117 / 130 | 5,00 s |
| Firma erfassen | fehlgeschlagen | 0 / 180 | 16,00 s |
| Person verknuepfen | fehlgeschlagen | 0 / 220 | 8,00 s |
| Fakt hinterlegen | fehlgeschlagen | 0 / 160 | 7,00 s |
| Entitaet suchen | bestanden | 14 / 140 | 60,00 s |
| Aufgabenliste anlegen | bestanden | 115 / 130 | 5,00 s |
| Aufgaben ergaenzen | bestanden | 147 / 170 | 9,00 s |
| Boards sichten | bestanden | 93 / 120 | 10,00 s |
| Board-Aufgabe anlegen | bestanden | 144 / 190 | 16,00 s |
| CSV nach JSON | fehlgeschlagen | 0 / 180 | 17,00 s |
| JSON validieren | bestanden | 112 / 140 | 10,00 s |
| Defektes JSON reparieren | bestanden | 175 / 220 | 17,00 s |
| Pruefsummen | bestanden | 16 / 160 | 62,00 s |
| Volltextsuche | bestanden | 129 / 150 | 7,00 s |
| Archiv packen | bestanden | 155 / 170 | 6,00 s |
| Bestandsaufnahme | bestanden | 90 / 120 | 11,00 s |
| Titelbild erzeugen | fehlgeschlagen | 0 / 250 | 25,00 s |
| Bild pruefen | bestanden | 117 / 130 | 5,00 s |
| Merken | bestanden | 126 / 150 | 8,00 s |
| Erinnern | bestanden | 104 / 120 | 6,00 s |
| Fachfrage delegieren | bestanden | 156 / 230 | 32,00 s |
| Gesamtbericht | bestanden | 199 / 240 | 17,00 s |
| Abschluss | bestanden | 166 / 200 | 14,00 s |
Konfiguration
# LLM-Benchmark Konfiguration
# Modell : MiniMax-M2.5
# Engine : vLLM
# Run-ID : run-20260722-161612-8d5f5c
# GPU : 3x NVIDIA RTX PRO 6000 Blackwell Max-Q Workstation Edition
# CPU : 34x AMD Ryzen Threadripper PRO 9965WX 24-Cores
# RAM : 125 GB
bench@llm-benchmark:~$ /usr/bin/python3 /usr/local/bin/vllm serve \
--model mratsim/MiniMax-M2.5-BF16-INT4-AWQ \
--served-model-name MiniMax-M2.5 \
--tensor-parallel-size 1 \
--pipeline-parallel-size 3 \
--max-model-len 164000 \
--gpu-memory-utilization 0.90 \
--load-format safetensors \
--trust-remote-code \
--enforce-eager \
--disable-custom-all-reduce \
--enable-auto-tool-choice \
--tool-call-parser minimax_m2 \
--reasoning-parser minimax_m2_append_think
| Engine | vllm |
| Modellalias | MiniMax-M2.5 |
| Kontextlaenge | 164000 |
| Modellpfad | mratsim/MiniMax-M2.5-BF16-INT4-AWQ |
| Alias | MiniMax-M2.5 |
| Tensor-Parallel | 1 |
| Pipeline-Parallel | 3 |
| Kontext | 164000 |
| GPU-Speicher | 0.90 |
| Load-Format | safetensors |
| Trust-Remote-Code | aktiv |
| Enforce-Eager | aktiv |
| Custom-AllReduce aus | aktiv |
| Auto-Tool-Choice | aktiv |
| Tool-Parser | minimax_m2 |
| Reasoning-Parser | minimax_m2_append_think |
