🤖
Harness-Benchmark
Wie gut löst das Modell echte Aufgaben?
Qualität in echten Agenten- und Chat-Aufgaben – das Modell muss reale Aufgaben mit Tools und mehreren Schritten bearbeiten. Bewertet nach Erfolgsquote und erreichten Aufgabenpunkten.
🎯 Erfolgsquote🏆 Aufgabenpunkte🔧 Tool-Nutzung🧠 echte Aufgaben
| # | Modell / Hersteller | Messwerte | Parallel | GPU / CPU / RAM | Runtime | ||
|---|---|---|---|---|---|---|---|
| 1 | Qwen2.5-32B-Instruct-AWQQwen (Alibaba) HarnessbenchmarkTool Usage V 1.0 | 13,4 % 235/1.760 Pkt · 15/15 Aufg. | 1× | AMD Radeon 8060S Graphics32x AMD RYZEN AI MAX+ 395 w/ Radeon 8060S · 31 GB RAM | openclaw_cliAWQ | Details → |
