Model comparison
Gemma 4 26B A4B vs Qwen 3.6 27B
Gemma 4 26B A4B vs Qwen 3.6 27B for local inference — VRAM, tokens/sec on RTX 4090 and M4 Max, and quality benchmarks side by side. Qwen 3.6 27B leads on quality, while Gemma 4 26B A4B decodes faster on an RTX 4090.
| Metric | ||
|---|---|---|
| Parameters | 25.2B | 27B |
| Active params (MoE) | 3.8B | dense |
| Context window | 256K | 262K |
| Quality tier | 82 | 99 |
| MMLU-Pro | 82.6 | 86.2 |
| GPQA Diamond | 82.3 | 87.8 |
| SWE-bench Verified | — | 77.2 |
| LiveCodeBench | 77.1 | 83.9 |
| VRAM (Q4_K_M) | 15.4 GB | 16.5 GB |
| Speed — RTX 4090 (tok/s) | 124.4 | 50.4 |
| Speed — M4 Max (tok/s) | 55.9 | 27.4 |
Which should you run?
Qwen 3.6 27B scores higher on the quality benchmarks, so pick it when answer quality matters most. Gemma 4 26B A4B is faster to decode on an RTX 4090 (124 vs 50 tok/s). Gemma 4 26B A4B needs less VRAM (15.4 GB at Q4_K_M), so it fits on smaller GPUs.