Powered bymario-alka.degodcore.detricoma.denoob2claw.de
Offene Daten · reproduzierbare Tests

LLM-Leistung
messbar gemacht.

Performance- und Harnessbenchmarks fuer Modelle, Hardware und Runtimes. Transparent, filterbar und direkt vergleichbar.

2 Testarten100% transparentAPI ready
root@benchmark-node:/opt/llm#DEMO READY
root@llm-benchmark:~$ benchmark run --model qwen3-32b --type full

SYSTEM vLLM endpoint bereit auf :8000

MODEL Qwen3-32B / FP8 / 32k Kontext

DEMO Interaktive Vorschau eines LLM-Laufs

OPENAI CHAT COMPLETION ยท STREAM

user> Warte auf Benchmarkstart ...

assistant>

TTFT--MILLISEKUNDEN
GENERATION--TOKEN / SEK.
HARNESS--PUNKTE / 100
01

Echte Performance

TTFT, Prefill- und Generation-Token/s statt theoretischer Spitzenwerte.

02

Harness-Qualitaet

Punkte und Erfolgsquoten aus vollstaendigen Agent- und Chatablaeufen.

03

Volle Transparenz

Modell, Quantisierung, Runtime und Hardware bleiben an jedem Lauf sichtbar.

Community-Favoriten

Top Modelle nach Benchmarks

Die am haeufigsten getesteten Modelle auf einen Blick.

Alle Modelle →
Die ersten veroeffentlichten Benchmarks bestimmen hier automatisch das Ranking.
Aktuelle Messungen

Leaderboard Snapshot

Alle Ergebnisse →
#Modell / HerstellerTypMesswerteGPU / CPU / RAMRuntimeDatum
Noch keine passenden Ergebnisse vorhanden.