Google
Gemma-4-26B-A4B-it
Performancebenchmark · gemessen am 22.07.2026 15:26
Benchmark-ID
run-20260722-165910-670419Performancetest Small 1.0MoE26BRuntime: godclawQuantisierung: Q8_0
Generation42,22tok/s
Prefill70,55tok/s
Time to First Token609,00ms
Gesamtdauer2,24s
Concurrency1parallel
Einordnung im Feld
51von 138 Systemen
Performancebenchmark · Leitmetrik: Generation-Speed (tok/s)
Dieser Lauf ist besser als 64 % aller vergleichbaren Systeme.
Generation
42,2 tok/s
+1 % vs Ø 41,6
Prefill
70,6 tok/s
-98 % vs Ø 2.823,9
Time to First Token
609 ms
-77 % vs Ø 2.670
Verteilung im Feld1 – 148 tok/s
Wie schlägt sich dieser Benchmark?
gpt-oss-20b3× AMD Radeon AI PRO R9700 · run-20260722-165909-85f64f
147,8 tok/s
gpt-oss-20b3× AMD Radeon AI PRO R9700 · run-20260722-165909-637af7
143,9 tok/s
gpt-oss-20b3× AMD Radeon AI PRO R9700 · run-20260722-165909-65d35f
137,7 tok/s
Nemotron-Cascade-2-30B-A3B3× AMD Radeon AI PRO R9700 · run-20260722-181156-a273f2
107,9 tok/s
Nemotron-3-Nano-Omni-30B-A3B-Reasoning3× AMD Radeon AI PRO R9700 · run-20260722-182228-95c528
102,9 tok/s
gpt-oss-120b3× AMD Radeon AI PRO R9700 · run-20260722-165909-4e3ede
99,8 tok/s
Qwen3-30B-A3B-Instruct-25073× AMD Radeon AI PRO R9700 · run-20260722-165907-cc8f3f
97,6 tok/s
NVIDIA-Nemotron-3-Nano-4B3× AMD Radeon AI PRO R9700 · run-20260722-190202-45dc8e
93,4 tok/s
Qwen3-30B-A3B-Thinking-25073× AMD Radeon AI PRO R9700 · run-20260722-165908-5712c8
91,4 tok/s
Qwen3-30B-A3B-Instruct-25073× AMD Radeon AI PRO R9700 · run-20260722-165907-b20fe5
91,0 tok/s
Qwen3-VL-30B-A3B-Instruct3× AMD Radeon AI PRO R9700 · run-20260722-165908-4d91c3
89,8 tok/s
Qwen3-30B-A3B-Thinking-25073× AMD Radeon AI PRO R9700 · run-20260722-165908-40e052
88,6 tok/s
Qwen3-Coder-30B-A3B-Instruct3× AMD Radeon AI PRO R9700 · run-20260722-165907-0a4b43
88,2 tok/s
Qwen3-30B-A3B-Thinking-25073× AMD Radeon AI PRO R9700 · run-20260722-165907-83951d
87,8 tok/s
Gemma-4-26B-A4B-it dieser LaufAMD Radeon Graphics · run-20260722-165910-670419
42,2 tok/s
Hardware
GPU: AMD Radeon Graphics · 0 GB VRAM
CPU: 32x AMD RYZEN AI MAX+ 395 w/ Radeon 8060S
RAM: 31 GB
Setup
Runtime: godclaw
Quantisierung: Q8_0
Modell: Gemma-4-26B-A4B-it
Konfiguration
# LLM-Benchmark Konfiguration
# Modell : Gemma-4-26B-A4B-it
# Engine : llama.cpp
# Run-ID : run-20260722-165910-670419
# GPU : AMD Radeon Graphics
# CPU : 32x AMD RYZEN AI MAX+ 395 w/ Radeon 8060S
# RAM : 31 GB
bench@llm-benchmark:~$ /home/godcore/llama.cpp/build-rocm/bin/llama-server \
--model /home/godcore/models/gemma4/gemma-4-26B-A4B-it-Q8_0.gguf \
--alias google/gemma-4-26B-A4B-it \
--host 0.0.0.0 \
--port 8000 \
--ctx-size 65536 \
--parallel 2 \
--gpu-layers 999 \
--flash-attn auto \
--cache-type-k q8_0 \
--cache-type-v q8_0 \
--reasoning off \
--jinja
| Engine | llamacpp |
| Modellalias | google/gemma-4-26B-A4B-it |
| Kontextlaenge | 65536 |
| Modellpfad | /home/godcore/models/gemma4/gemma-4-26B-A4B-it-Q8_0.gguf |
| Parallel | 2 |
| GPU-Layer | 999 |
| Flash Attention | auto |
| K-Cache-Typ | q8_0 |
| V-Cache-Typ | q8_0 |
| Reasoning | off |
| Jinja | aktiv |
