Echte Performance
TTFT, Prefill- und Generation-Token/s statt theoretischer Spitzenwerte.
Performance- und Harnessbenchmarks fuer Modelle, Hardware und Runtimes. Transparent, filterbar und direkt vergleichbar.
SYSTEM vLLM endpoint bereit auf :8000
MODEL Qwen3-32B / FP8 / 32k Kontext
DEMO Interaktive Vorschau eines LLM-Laufs
user> Warte auf Benchmarkstart ...
assistant>
TTFT, Prefill- und Generation-Token/s statt theoretischer Spitzenwerte.
Punkte und Erfolgsquoten aus vollstaendigen Agent- und Chatablaeufen.
Modell, Quantisierung, Runtime und Hardware bleiben an jedem Lauf sichtbar.
Die am haeufigsten getesteten Modelle auf einen Blick.
| # | Modell / Hersteller | Typ | Messwerte | GPU / CPU / RAM | Runtime | Datum |
|---|---|---|---|---|---|---|
Noch keine passenden Ergebnisse vorhanden. | ||||||