willitrun·ai

Model comparison

Gemma 4 12B vs Qwen 3.6 27B

Gemma 4 12B vs Qwen 3.6 27B for local inference — VRAM, tokens/sec on RTX 4090 and M4 Max, and quality benchmarks side by side. Qwen 3.6 27B leads on quality, while Gemma 4 12B decodes faster on an RTX 4090.

MetricGoogle Gemma 4 12BAlibaba Qwen 3.6 27B
Parameters12B27B
Active params (MoE)densedense
Context window262K262K
Quality tier7499
MMLU-Pro86.2
GPQA Diamond87.8
SWE-bench Verified77.2
LiveCodeBench83.9
VRAM (Q4_K_M)7.3 GB16.5 GB
Speed — RTX 4090 (tok/s)109.950.4
Speed — M4 Max (tok/s)43.427.4

Which should you run?

Qwen 3.6 27B scores higher on the quality benchmarks, so pick it when answer quality matters most. Gemma 4 12B is faster to decode on an RTX 4090 (110 vs 50 tok/s). Gemma 4 12B needs less VRAM (7.3 GB at Q4_K_M), so it fits on smaller GPUs.