Created bymario-alka.dePowered bygodcore.denoob2claw.detricoma.de
🌐
🤖
Harness-Benchmark

Wie gut löst das Modell echte Aufgaben?

Qualität in echten Agenten- und Chat-Aufgaben – das Modell muss reale Aufgaben mit Tools und mehreren Schritten bearbeiten. Bewertet nach Erfolgsquote und erreichten Aufgabenpunkten.

🎯 Erfolgsquote🏆 Aufgabenpunkte🔧 Tool-Nutzung🧠 echte Aufgaben
Reset
#Modell / HerstellerMesswerteParallelGPU / CPU / RAMRuntime
1Qwen2.5-32B-Instruct-AWQQwen (Alibaba) HarnessbenchmarkTool Usage V 1.0
13,4 %
235/1.760 Pkt · 15/15 Aufg.
1×AMD Radeon 8060S Graphics32x AMD RYZEN AI MAX+ 395 w/ Radeon 8060S · 31 GB RAMopenclaw_cliAWQ