Performancebenchmark
Direkter Aufruf einer OpenAI-kompatiblen Chat-Completions-API. Erfasst werden Time to First Token, Prefill-Token/s, Generation-Token/s und die gesamte Laufzeit. Modell, Runtime, Quantisierung und Systemdaten gehoeren zum Ergebnis.
Harnessbenchmark
Das Modell laeuft durch einen vollstaendigen Agent- oder Chat-Harness. Bewertet werden erreichte Punkte, maximal moegliche Punkte und Erfolgsquote. Dadurch wird neben Geschwindigkeit auch die praktische Aufgabenerfuellung sichtbar.
Vergleichbarkeit
Ergebnisse sind nur unter identischen Benchmarks und vergleichbaren Einstellungen direkt belastbar. Verifizierte Laeufe sind im Leaderboard markiert.
