Created bymario-alka.dePowered bygodcore.denoob2claw.detricoma.de
MiniMax

MiniMax-M2.5

Harnessbenchmark · gemessen am 19.07.2026 22:44

Benchmark-IDrun-20260722-161612-8d5f5c
Tool-Parcours Dossier 40 V1.0MoE230BRuntime: godclawQuantisierung: BF16
Punkte3.622,00von 5.960,00
Punktequote60,77%
Aufgaben bestanden34von 40
Gesamtdauer7.862,00s
Einordnung im Feld
16von 30 Systemen

Harnessbenchmark · Leitmetrik: Punktequote (%)

Dieser Lauf ist besser als 48 % aller vergleichbaren Systeme.
Punktequote 61 %
+12 % vs Ø 54,4
Aufgaben bestanden 34
+83 % vs Ø 18,6
Gesamtdauer 7.862,0 s
+228 % vs Ø 2.395,9
Verteilung im Feld10 – 91 %
Ø 54 Median Dieser Lauf

Wie schlägt sich dieser Benchmark?

Hardware

GPU: 3x NVIDIA RTX PRO 6000 Blackwell Max-Q Workstation Edition · 96 GB VRAM
CPU: 34x AMD Ryzen Threadripper PRO 9965WX 24-Cores
RAM: 125 GB

Setup

Runtime: godclaw
Quantisierung: BF16
Modell: MiniMax-M2.5

Aufgaben (40)

AufgabeStatusPunkteDauer
Arbeitsstruktur anlegenbestanden5 / 507.214,00 s
Startdatei schreibenbestanden9 / 6019,00 s
Datei zuruecklesenbestanden38 / 504,00 s
CSV mit Testdatenbestanden46 / 8014,00 s
Struktur pruefenfehlgeschlagen0 / 6069,00 s
Recherche RAGbestanden92 / 15026,00 s
Recherche Herstellerbestanden94 / 12011,00 s
Recherche sichernbestanden55 / 10015,00 s
Webseite auswertenbestanden60 / 14038,00 s
Seite im Browser oeffnenbestanden164 / 1809,00 s
Modellvergleichbestanden150 / 20021,00 s
Quellenlistebestanden66 / 909,00 s
Wissenskategorien sichtenbestanden82 / 1006,00 s
Wissenseintrag anlegenbestanden186 / 22013,00 s
Wissenseintrag pruefenbestanden104 / 1206,00 s
Wissenseintrag ergaenzenbestanden170 / 20010,00 s
Versionen zaehlenbestanden126 / 1405,00 s
Wissen durchsuchenbestanden117 / 1305,00 s
Firma erfassenfehlgeschlagen0 / 18016,00 s
Person verknuepfenfehlgeschlagen0 / 2208,00 s
Fakt hinterlegenfehlgeschlagen0 / 1607,00 s
Entitaet suchenbestanden14 / 14060,00 s
Aufgabenliste anlegenbestanden115 / 1305,00 s
Aufgaben ergaenzenbestanden147 / 1709,00 s
Boards sichtenbestanden93 / 12010,00 s
Board-Aufgabe anlegenbestanden144 / 19016,00 s
CSV nach JSONfehlgeschlagen0 / 18017,00 s
JSON validierenbestanden112 / 14010,00 s
Defektes JSON reparierenbestanden175 / 22017,00 s
Pruefsummenbestanden16 / 16062,00 s
Volltextsuchebestanden129 / 1507,00 s
Archiv packenbestanden155 / 1706,00 s
Bestandsaufnahmebestanden90 / 12011,00 s
Titelbild erzeugenfehlgeschlagen0 / 25025,00 s
Bild pruefenbestanden117 / 1305,00 s
Merkenbestanden126 / 1508,00 s
Erinnernbestanden104 / 1206,00 s
Fachfrage delegierenbestanden156 / 23032,00 s
Gesamtberichtbestanden199 / 24017,00 s
Abschlussbestanden166 / 20014,00 s

Konfiguration

benchmark-konfiguration — run-20260722-161612-8d5f5c
# LLM-Benchmark Konfiguration # Modell : MiniMax-M2.5 # Engine : vLLM # Run-ID : run-20260722-161612-8d5f5c # GPU : 3x NVIDIA RTX PRO 6000 Blackwell Max-Q Workstation Edition # CPU : 34x AMD Ryzen Threadripper PRO 9965WX 24-Cores # RAM : 125 GB bench@llm-benchmark:~$ /usr/bin/python3 /usr/local/bin/vllm serve \ --model mratsim/MiniMax-M2.5-BF16-INT4-AWQ \ --served-model-name MiniMax-M2.5 \ --tensor-parallel-size 1 \ --pipeline-parallel-size 3 \ --max-model-len 164000 \ --gpu-memory-utilization 0.90 \ --load-format safetensors \ --trust-remote-code \ --enforce-eager \ --disable-custom-all-reduce \ --enable-auto-tool-choice \ --tool-call-parser minimax_m2 \ --reasoning-parser minimax_m2_append_think
Enginevllm
ModellaliasMiniMax-M2.5
Kontextlaenge164000
Modellpfadmratsim/MiniMax-M2.5-BF16-INT4-AWQ
AliasMiniMax-M2.5
Tensor-Parallel1
Pipeline-Parallel3
Kontext164000
GPU-Speicher0.90
Load-Formatsafetensors
Trust-Remote-Codeaktiv
Enforce-Eageraktiv
Custom-AllReduce ausaktiv
Auto-Tool-Choiceaktiv
Tool-Parserminimax_m2
Reasoning-Parserminimax_m2_append_think

Alle Benchmarks dieses Modells Zum Leaderboard