Model comparison
Gemma 4 31B vs Gemma 4 12B
Gemma 4 31B vs Gemma 4 12B for local inference — VRAM, tokens/sec on RTX 4090 and M4 Max, and quality benchmarks side by side. Gemma 4 31B leads on quality, while Gemma 4 12B decodes faster on an RTX 4090.
| Metric | ||
|---|---|---|
| Parameters | 30.7B | 12B |
| Active params (MoE) | dense | dense |
| Context window | 256K | 262K |
| Quality tier | 86 | 74 |
| MMLU-Pro | 85.2 | — |
| GPQA Diamond | 84.3 | — |
| SWE-bench Verified | — | — |
| LiveCodeBench | 80.0 | — |
| VRAM (Q4_K_M) | 18.7 GB | 7.3 GB |
| Speed — RTX 4090 (tok/s) | 13.0 | 109.9 |
| Speed — M4 Max (tok/s) | 25.5 | 43.4 |
Which should you run?
Gemma 4 31B scores higher on the quality benchmarks, so pick it when answer quality matters most. Gemma 4 12B is faster to decode on an RTX 4090 (110 vs 13 tok/s). Gemma 4 12B needs less VRAM (7.3 GB at Q4_K_M), so it fits on smaller GPUs.