Created bymario-alka.dePowered bygodcore.denoob2claw.detricoma.de
🌐
MiniMax

MiniMax-M2.7-AWQ-4bit

Performancebenchmark · gemessen am 23.07.2026 05:35

Benchmark-IDrun-20260723-055735-105350
Timebench 3 - Kombi (Prefill + Generation)MoE230BRuntime: vLLMQuantisierung: AWQ
Zur Einordnung: Diese Plattform nutzt Unified Memory – die "VRAM" ist gemeinsamer System-RAM (APU/Superchip); das Modell teilt sich den Speicher mit dem System.
Generation106,12tok/s
Prefill5.634,40tok/s
Time to First Token12.854,00ms
Gesamtdauer99,40s
Concurrency5parallel
Einordnung im Feld
79von 347 Systemen

Performancebenchmark · Leitmetrik: Generation-Speed (tok/s)

Dieser Lauf ist besser als 77 % aller vergleichbaren Systeme.
Generation 106,1 tok/s
+6 % vs Ø 100,2
Prefill 5.634,4 tok/s
+66 % vs Ø 3.396,8
Time to First Token 12.854 ms
-39 % vs Ø 21.178
Verteilung im Feld0 – 1.444 tok/s
Ø 100 Median Dieser Lauf

Wie schlägt sich dieser Benchmark?

Hardware

GPU: NVIDIA GB10 · 128 GB VRAM
CPU: NVIDIA Grace
RAM: 120 GB

Setup

Runtime: vLLM
Quantisierung: AWQ
Treiber: NVIDIA 590.48.01 / CUDA 13.1
Modell: MiniMax-M2.7-AWQ-4bit

Konfiguration

benchmark-konfiguration — run-20260723-055735-105350
# LLM-Benchmark Konfiguration # Modell : MiniMax-M2.7-AWQ-4bit # Engine : vLLM # Run-ID : run-20260723-055735-105350 # GPU : NVIDIA GB10 # CPU : NVIDIA Grace # RAM : 120 GB bench@llm-benchmark:~$ /usr/bin/python /usr/local/bin/vllm serve cyankiwi/MiniMax-M2.7-AWQ-4bit \ --host 0.0.0.0 \ --port 8000 \ --tensor-parallel-size 2 \ --distributed-executor-backend ray \ --gpu-memory-utilization 0.8 \ --max-model-len 196608 \ --max-num-seqs 4 \ --load-format fastsafetensors \ --tool-call-parser minimax_m2 \ --reasoning-parser minimax_m2 \ --enable-auto-tool-choice \ --kv-cache-dtype fp8_e4m3 \ --enable-prefix-caching \ --trust-remote-code \ --enforce-eager \ --served-model-name cyankiwi/MiniMax-M2.7-AWQ-4bit
Engine?Die Inferenz-Software, die das Modell ausliefert (z.B. vLLM oder llama.cpp). Sie bestimmt Geschwindigkeit, unterstuetzte Modellformate und welche Parameter ueberhaupt verfuegbar sind.vllm
Modellalias?Der Name, unter dem das Modell ueber die API angesprochen wird. Genau dieser Wert muss im Request-Feld 'model' stehen.cyankiwi/MiniMax-M2.7-AWQ-4bit
Kontextlaenge?Maximale Anzahl Tokens (Eingabe + erzeugte Ausgabe zusammen), die das Modell pro Anfrage verarbeiten kann.196608
Tensor-Parallel?Anzahl GPUs, auf die JEDER einzelne Modell-Layer aufgeteilt wird (Tensor-Parallelitaet). Mehr GPUs = mehr VRAM und meist mehr Speed, aber die Anzahl der Attention-Heads muss durch diesen Wert teilbar sein (z.B. 32 Heads -> nur 1, 2, 4, 8 ... moeglich, NICHT 3).2
Executor-Backend?Verfahren fuer Multi-GPU/Multi-Node: mp = Prozesse auf einer Maschine, ray = ueber Ray (auch ueber mehrere Knoten).ray
GPU-Speicher?Anteil des GPU-Speichers (0 bis 1), den vLLM belegen darf. 0.92 = 92 %. Hoeher = mehr Platz fuer den KV-Cache (mehr/laengere parallele Anfragen), aber groesseres Risiko fuer 'Out of Memory'.0.8
Kontext?Groesse des Kontextfensters in Token. 0 = der beim Training verwendete Kontext des Modells.196608
Max-Sequenzen?Maximale Anzahl gleichzeitig bearbeiteter Anfragen (Batch-Groesse). Hoeher = mehr Durchsatz, braucht aber mehr KV-Cache-Speicher.4
Load-Format?Format, aus dem die Gewichte geladen werden (auto, safetensors, pt ...). 'auto' erkennt es selbst.fastsafetensors
Tool-Parser?Bestimmt, wie vLLM Tool-Aufrufe aus der Modellantwort ausliest (z.B. hermes, mistral, llama3_json). Muss zum Modell passen.minimax_m2
Reasoning-Parser?Trennt den Denk-/Reasoning-Teil der Antwort vom eigentlichen Inhalt (z.B. bei Modellen mit <think>-Bloecken).minimax_m2
Auto-Tool-Choice?Erlaubt dem Modell, Tools (Function-Calling) selbststaendig auszuwaehlen. MUSS aktiv sein, damit 'tools' im Request akzeptiert werden - sonst lehnt vLLM sie mit HTTP 400 ab.aktiv
KV-Cache-Dtype?Datentyp des KV-Cache (auto, fp8). fp8 halbiert etwa den Cache-Speicher -> mehr und laengere parallele Anfragen bei minimalem Qualitaetsverlust.fp8_e4m3
Prefix-Caching?Speichert bereits berechnete Prompt-Anfaenge und verwendet sie wieder. Beschleunigt Anfragen mit gemeinsamem Praefix (z.B. gleicher System-Prompt) deutlich.aktiv
Trust-Remote-Code?Erlaubt vLLM, mit dem Modell mitgelieferten Python-Code auszufuehren. Noetig fuer Architekturen, die vLLM nicht von Haus aus kennt. Nur bei vertrauenswuerdigen Modellen aktivieren.aktiv
Enforce-Eager?Schaltet die optimierte Graph-Ausfuehrung (CUDA-/HIP-Graphs) AB und rechnet Schritt fuer Schritt. Startet schneller und spart etwas VRAM, ist im laufenden Betrieb aber meist langsamer als mit Graphs.aktiv
Alias?Anzeigename des Modells nach aussen (served model name), unabhaengig vom Dateinamen.cyankiwi/MiniMax-M2.7-AWQ-4bit

Alle Benchmarks dieses Modells Zum Leaderboard

Modell-Vergleich

MiniMax-M2.7-AWQ-4bit auf verschiedener Hardware

Alle veroeffentlichten Performance-Läufe dieses Modells – jede Blase eine Variante: Position = Prefill (X) × Generation (Y), Blasengröße = Anzahl Läufe. Näher oben rechts = schneller. ★ Gold markiert = dieser Benchmark.

GPUnach Grafikkarte

1921831741651573.1743.3093.4443.580Prefill (tok/s)Generation (tok/s)NVIDIA GB10 (DGX Spark) - 174,2 tok/s Generation, 3.377 tok/s Prefill, TTFT 15.392 ms (4 Laufe) | DIESER LAUF★ NVIDIA GB10 (DGX Spar...
★ NVIDIA GB10 (DGX Spark) 174,2 tok/s dieser Lauf

CPUnach Prozessor

1921831741651573.1743.3093.4443.580Prefill (tok/s)Generation (tok/s)NVIDIA Grace - 174,2 tok/s Generation, 3.377 tok/s Prefill, TTFT 15.392 ms (4 Laufe) | DIESER LAUF★ NVIDIA Grace
★ NVIDIA Grace 174,2 tok/s dieser Lauf

MBnach Mainboard

1921831741651573.1743.3093.4443.580Prefill (tok/s)Generation (tok/s)unbekannt - 174,2 tok/s Generation, 3.377 tok/s Prefill, TTFT 15.392 ms (4 Laufe)unbekannt
unbekannt 174,2 tok/s

ENGnach Engine

1921831741651573.1743.3093.4443.580Prefill (tok/s)Generation (tok/s)vLLM - 174,2 tok/s Generation, 3.377 tok/s Prefill, TTFT 15.392 ms (4 Laufe) | DIESER LAUF★ vLLM
★ vLLM 174,2 tok/s dieser Lauf

DRVnach Treiber

1921831741651573.1743.3093.4443.580Prefill (tok/s)Generation (tok/s)NVIDIA 590.48.01 / CUDA 13.1 - 174,2 tok/s Generation, 3.377 tok/s Prefill, TTFT 15.392 ms (4 Laufe) | DIESER LAUF★ NVIDIA 590.48.01 / CU...
★ NVIDIA 590.48.01 / CUDA 13.1 174,2 tok/s dieser Lauf