Created bymario-alka.dePowered bygodcore.denoob2claw.detricoma.de
Google

Gemma-4-26B-A4B-it

Harnessbenchmark · gemessen am 16.07.2026 07:55

Benchmark-IDrun-20260722-161611-0064a9
Tool Usage Standard 1.0MoE26BRuntime: godclawQuantisierung: Q8_0
Zur Einordnung: Diese Plattform nutzt Unified Memory – die "VRAM" ist gemeinsamer System-RAM (APU/Superchip); das Modell teilt sich den Speicher mit dem System.
Punkte2.268,00von 2.980,00
Punktequote76,11%
Aufgaben bestanden16von 16
Gesamtdauer347,00s
Einordnung im Feld
7von 30 Systemen

Harnessbenchmark · Leitmetrik: Punktequote (%)

Dieser Lauf ist besser als 79 % aller vergleichbaren Systeme.
Punktequote 76 %
+40 % vs Ø 54,4
Aufgaben bestanden 16
-14 % vs Ø 18,6
Gesamtdauer 347,0 s
-86 % vs Ø 2.395,9
Verteilung im Feld10 – 91 %
Ø 54 Median Dieser Lauf

Wie schlägt sich dieser Benchmark?

Hardware

GPU: AMD GPU
CPU: 32x AMD RYZEN AI MAX+ 395 w/ Radeon 8060S
RAM: 31 GB
Mainboard: Meigao Innovation Technology (Shen Zhen) Co., Ltd SHWSA (MS-S1 MAX)

Setup

Runtime: godclaw
Quantisierung: Q8_0
Betriebssystem: Ubuntu 24.04.2 LTS (Kernel 6.17.0-40-generic)
Treiber: ROCm 7.2.0
Modell: Gemma-4-26B-A4B-it

Aufgaben (16)

AufgabeStatusPunkteDauer
Antwortzeit Testbestanden35 / 505,00 s
Format Testbestanden70 / 804,00 s
Dateisystem Setupbestanden98 / 1209,00 s
Daten Generierungbestanden141 / 1504,00 s
Parsing + Transformationbestanden108 / 20046,00 s
Fehlerbehandlung JSONbestanden15 / 150112,00 s
Python Tool Usagebestanden176 / 22020,00 s
PHP Tool Usagebestanden183 / 22017,00 s
Export + Reimportbestanden213 / 24015,00 s
Archivierungbestanden148 / 18012,00 s
Hash Berechnungbestanden154 / 20019,00 s
Textsuchebestanden167 / 1805,00 s
Idempotenz Testbestanden211 / 2204,00 s
Rechte Problembestanden110 / 22050,00 s
Final JSONbestanden223 / 25011,00 s
Finale Ausgabebestanden216 / 30014,00 s

Konfiguration

benchmark-konfiguration — run-20260722-161611-0064a9
# LLM-Benchmark Konfiguration # Modell : Gemma-4-26B-A4B-it # Engine : llama.cpp # Run-ID : run-20260722-161611-0064a9 # GPU : AMD GPU # CPU : 32x AMD RYZEN AI MAX+ 395 w/ Radeon 8060S # RAM : 31 GB bench@llm-benchmark:~$ /home/godcore/llama.cpp/build-rocm/bin/llama-server \ --model /home/godcore/models/gemma4/gemma-4-26B-A4B-it-Q8_0.gguf \ --alias google/gemma-4-26B-A4B-it \ --host 0.0.0.0 \ --port 8000 \ --ctx-size 65536 \ --parallel 2 \ --gpu-layers 999 \ --flash-attn auto \ --cache-type-k q8_0 \ --cache-type-v q8_0 \ --reasoning off \ --jinja
Engine?Die Inferenz-Software, die das Modell ausliefert (z.B. vLLM oder llama.cpp). Sie bestimmt Geschwindigkeit, unterstuetzte Modellformate und welche Parameter ueberhaupt verfuegbar sind.llamacpp
Modellalias?Der Name, unter dem das Modell ueber die API angesprochen wird. Genau dieser Wert muss im Request-Feld 'model' stehen.google/gemma-4-26B-A4B-it
Kontextlaenge?Maximale Anzahl Tokens (Eingabe + erzeugte Ausgabe zusammen), die das Modell pro Anfrage verarbeiten kann.65536
Modellpfad?Pfad zur GGUF-Modelldatei, die geladen und ausgeliefert wird./home/godcore/models/gemma4/gemma-4-26B-A4B-it-Q8_0.gguf
Parallel?Anzahl paralleler Slots/Sequenzen, die der Server gleichzeitig bedient. Der Kontext wird auf die Slots aufgeteilt.2
GPU-Layer?Anzahl der auf die GPU ausgelagerten Modell-Layer. Hoeher = mehr VRAM und schneller; der Rest laeuft auf der CPU. 999 = alles auf GPU.999
Flash Attention?FlashAttention fuer schnellere und speichersparende Attention. Wert on/off/auto je nach Build.auto
K-Cache-Typ?Datentyp des K-Anteils im KV-Cache (f16/q8_0/q4_0 ...). Quantisiert senkt den VRAM-Bedarf bei leichtem Qualitaetsverlust.q8_0
V-Cache-Typ?Datentyp des V-Anteils im KV-Cache (f16/q8_0/q4_0 ...). Quantisierung braucht meist aktiviertes flash-attn.q8_0
Reasoning?Steuert die Ausgabe bzw. das Parsing von Reasoning-/Thinking-Inhalten (z.B. --reasoning-format deepseek/none).off
Jinja?Nutzt die im Modell eingebettete Jinja-Chat-Vorlage fuer korrekte Rollen-, Tool- und Reasoning-Formatierung.aktiv

Alle Benchmarks dieses Modells Zum Leaderboard

Modell-Vergleich

Gemma-4-26B-A4B-it auf verschiedener Hardware

Alle veroeffentlichten Performance-Läufe dieses Modells – jede Blase eine Variante: Position = Prefill (X) × Generation (Y), Blasengröße = Anzahl Läufe. Näher oben rechts = schneller. ★ Gold markiert = dieser Benchmark.

GPUnach Grafikkarte

46,444,342,240,138,0166173180187Prefill (tok/s)Generation (tok/s)AMD Radeon 8060S Graphics - 42,2 tok/s Generation, 176 tok/s Prefill, TTFT 3.801 ms (2 Laufe)AMD Radeon 8060S Grap...
AMD Radeon 8060S Graphics 42,2 tok/s

CPUnach Prozessor

46,444,342,240,138,0166173180187Prefill (tok/s)Generation (tok/s)AMD RYZEN AI MAX+ 395 w/ Radeon 8060S - 42,2 tok/s Generation, 176 tok/s Prefill, TTFT 3.801 ms (2 Laufe) | DIESER LAUF★ AMD RYZEN AI MAX+ 395...
★ AMD RYZEN AI MAX+ 395 w/ Radeon 8060S 42,2 tok/s dieser Lauf

MBnach Mainboard

46,444,342,240,138,0166173180187Prefill (tok/s)Generation (tok/s)Meigao Innovation Technology (Shen Zhen) Co., Ltd SHWSA (MS-S1 MAX) - 42,2 tok/s Generation, 176 tok/s Prefill, TTFT 3.801 ms (2 Laufe) | DIESER LAUF★ Meigao Innovation Tec...
★ Meigao Innovation Technology (Shen Zhen) Co., Ltd SHWSA (MS-S1 MAX) 42,2 tok/s dieser Lauf

ENGnach Engine

46,444,342,240,138,0166173180187Prefill (tok/s)Generation (tok/s)llama.cpp - 42,2 tok/s Generation, 176 tok/s Prefill, TTFT 3.801 ms (2 Laufe) | DIESER LAUF★ llama.cpp
★ llama.cpp 42,2 tok/s dieser Lauf

DRVnach Treiber

46,444,342,240,138,0166173180187Prefill (tok/s)Generation (tok/s)ROCm 7.2.0 - 42,2 tok/s Generation, 176 tok/s Prefill, TTFT 3.801 ms (2 Laufe) | DIESER LAUF★ ROCm 7.2.0
★ ROCm 7.2.0 42,2 tok/s dieser Lauf