Qwen3 32B
Qwen3 32B needs roughly 23.9 GB VRAM at Q4_K_M quantization (75.0 GB at FP16). 74 GPUs we track can run it fully in VRAM at 8k context.
74 GPUs run this natively · 31 with CPU offload
Qwen3 32B is a 32.8B parameter dense model developed by Alibaba. Dense 32B model with thinking/non-thinking mode support.
To run Qwen3 32B locally: Q4_K_M's real total is ~23.9GB once KV cache and overhead are counted, just past a 24GB card's ~22.8GB effective capacity -- same tier as Qwen2.5-32B, both need CPU offload or a lower quant on a real 24GB card.
Chain-of-thought capabilities at 32B scale, strong reasoning with Apache 2.0 licensing.
VRAM at each quantization
Qwen3 32B natively supports a longer context window, but the table below is capped at 8k for comparability; KV cache grows linearly with context length.
| Quant | Weights | KV cache | Total |
|---|---|---|---|
| FP32 | 131.2 GB | 1.34 GB | 148.4 GB |
| BF16 | 65.6 GB | 1.34 GB | 75.0 GB |
| FP16 | 65.6 GB | 1.34 GB | 75.0 GB |
| Q8_0 | 34.9 GB | 1.34 GB | 40.5 GB |
| Q6_K | 26.9 GB | 1.34 GB | 31.7 GB |
| Q5_K_M | 23.4 GB | 1.34 GB | 27.7 GB |
| Q4_K_Mrec | 20.0 GB | 1.34 GB | 23.9 GB |
| Q3_K_M | 15.8 GB | 1.34 GB | 19.2 GB |
| Q2_K | 12.5 GB | 1.34 GB | 15.5 GB |
| NVFP4cuda | 16.4 GB | 1.34 GB | 19.9 GB |
KV cache figures assume 8k context at FP16. NVFP4 quantization requires a CUDA-capable GPU. Enable TurboQuant in the calculator to see reduced KV cache estimates.
Benchmarks
GPUs that run Qwen3 32B natively (74)
- NVIDIA RTX 5090NVFP4 · 65.7 t/s
- NVIDIA RTX 4090Q3_K_M · 38.3 t/s
- NVIDIA RTX 3090Q3_K_M · 35.5 t/s
- NVIDIA RTX 3090 TiQ3_K_M · 38.3 t/s
- NVIDIA B300 288GBBF16 · 77.7 t/s
Show 69 more
- NVIDIA B200 180GBBF16 · 77.7 t/s
- NVIDIA H200 141GBBF16 · 46.6 t/s
- NVIDIA H100 80GBBF16 · 32.5 t/s
- NVIDIA A100 80GBBF16 · 19.8 t/s
- NVIDIA A100 40GBQ6_K · 35.8 t/s
- NVIDIA L40SQ8_0 · 15.5 t/s
- NVIDIA RTX A6000Q8_0 · 13.8 t/s
- NVIDIA RTX 4000 AdaQ2_K · 15 t/s
- NVIDIA RTX 4500 AdaQ3_K_M · 16.4 t/s
- NVIDIA RTX 5000 AdaQ5_K_M · 15.2 t/s
- NVIDIA RTX 6000 AdaQ8_0 · 17.2 t/s
- NVIDIA RTX Pro 6000BF16 · 13.1 t/s
- NVIDIA DGX Spark (128GB)BF16 · 2.7 t/s
- AMD Radeon RX 7900 XTXQ3_K_M · 36.5 t/s
- AMD Radeon RX 7900 XTQ2_K · 37.6 t/s
- AMD Radeon PRO W7800Q5_K_M · 15.2 t/s
- AMD Radeon PRO W7900Q8_0 · 15.5 t/s
- AMD Instinct MI300XBF16 · 51.5 t/s
- AMD Radeon AI PRO R9700 32GBQ5_K_M · 16.8 t/s
- AMD Strix Halo (128GB)BF16 · 2.5 t/s
- AMD Strix Halo (96GB)BF16 · 2.5 t/s
- AMD Strix Halo (64GB)Q8_0 · 4.6 t/s
- AMD Strix Halo (32GB)Q4_K_M · 7.8 t/s
- Apple M5 Ultra (512GB)BF16 · 14.3 t/s
- Apple M5 Ultra (256GB)BF16 · 14.3 t/s
- Apple M5 Ultra (96GB)BF16 · 14.3 t/s
- Apple M5 Max (128GB)BF16 · 7.3 t/s
- Apple M5 Max (64GB)Q8_0 · 13.6 t/s
- Apple M5 Max (48GB)Q6_K · 17.4 t/s
- Apple M5 Max (36GB)Q5_K_M · 14.9 t/s
- Apple M5 Pro (64GB)Q8_0 · 6.8 t/s
- Apple M5 Pro (48GB)Q6_K · 8.7 t/s
- Apple M5 Pro (24GB)Q2_K · 17.7 t/s
- Apple M5 (32GB)Q4_K_M · 5.7 t/s
- Apple M6 (32GB)Q4_K_M · 6.4 t/s
- Apple M4 Max (128GB)BF16 · 6.5 t/s
- Apple M4 Max (64GB)Q8_0 · 12.1 t/s
- Apple M4 Max (48GB)Q6_K · 15.5 t/s
- Apple M4 Max (36GB)Q5_K_M · 13.3 t/s
- Apple M4 Pro (48GB)Q6_K · 7.7 t/s
- Apple M4 Pro (24GB)Q2_K · 15.8 t/s
- Apple M4 (32GB)Q4_K_M · 4.5 t/s
- Apple M3 Ultra (512GB)BF16 · 9.8 t/s
- Apple M3 Ultra (256GB)BF16 · 9.8 t/s
- Apple M3 Ultra (96GB)BF16 · 9.8 t/s
- Apple M3 Max (128GB)BF16 · 4.8 t/s
- Apple M3 Max (96GB)BF16 · 3.6 t/s
- Apple M3 Max (64GB)Q8_0 · 8.8 t/s
- Apple M3 Max (48GB)Q6_K · 11.3 t/s
- Apple M3 Max (36GB)Q5_K_M · 9.7 t/s
- Apple M3 Pro (36GB)Q5_K_M · 4.9 t/s
- Apple M3 (24GB)Q2_K · 5.8 t/s
- Apple M2 Ultra (192GB)BF16 · 9.6 t/s
- Apple M2 Ultra (64GB)Q8_0 · 17.7 t/s
- Apple M2 Max (96GB)BF16 · 4.8 t/s
- Apple M2 Max (64GB)Q8_0 · 8.8 t/s
- Apple M2 Max (32GB)Q4_K_M · 15 t/s
- Apple M2 Pro (32GB)Q4_K_M · 7.5 t/s
- Apple M2 (24GB)Q2_K · 5.8 t/s
- Apple M1 Ultra (128GB)BF16 · 9.6 t/s
- Apple M1 Ultra (64GB)Q8_0 · 17.7 t/s
- Apple M1 Max (64GB)Q8_0 · 8.8 t/s
- Apple M1 Max (32GB)Q4_K_M · 15 t/s
- Apple M1 Pro (32GB)Q4_K_M · 7.5 t/s
- Intel Arc Pro B70 32GBQ5_K_M · 16 t/s
- Intel Arc Pro B60 24GBQ3_K_M · 14.4 t/s
- Intel Data Center GPU Max 1550BF16 · 31.8 t/s
- Intel Data Center GPU Max 1100Q8_0 · 22.1 t/s
- Intel Arc 140V (32GB)Q4_K_M · 4.2 t/s
Plus 31 GPUs that run it with CPU offload (slower)
- NVIDIA RTX 5080NVFP4 · 7.9 t/s
- NVIDIA RTX 5070 TiNVFP4 · 7.8 t/s
- NVIDIA RTX 5070NVFP4 · 3.6 t/s
- NVIDIA RTX 5060 Ti 16GBNVFP4 · 6.5 t/s
- NVIDIA RTX 5060 Ti 8GBNVFP4 · 2.3 t/s
- NVIDIA RTX 5060NVFP4 · 2.3 t/s
- NVIDIA RTX 5050NVFP4 · 2.3 t/s
- NVIDIA RTX 4080Q8_0 · 1.1 t/s
- NVIDIA RTX 4070 Ti SUPERQ8_0 · 1.1 t/s
- NVIDIA RTX 4070 TiQ6_K · 1.4 t/s
- NVIDIA RTX 4070 SUPERQ6_K · 1.4 t/s
- NVIDIA RTX 4070Q6_K · 1.4 t/s
- NVIDIA RTX 4060 Ti 16GBQ8_0 · 1.1 t/s
- NVIDIA RTX 4060Q6_K · 1.1 t/s
- NVIDIA RTX 3080 10GBQ6_K · 1.3 t/s
- NVIDIA RTX 3060 12GBQ6_K · 1.4 t/s
- AMD Radeon RX 7900 GREQ8_0 · 1.1 t/s
- AMD Radeon RX 6800 XTQ8_0 · 1.1 t/s
- Intel Arc B580 12GBQ6_K · 1.4 t/s
- Intel Arc B570 10GBQ6_K · 1.3 t/s
- Intel Arc Pro B50 16GBQ8_0 · 1.1 t/s
- Intel Arc A770 16GBQ8_0 · 1.1 t/s
- Intel Arc A770 8GBQ6_K · 1.2 t/s
- Intel Arc A750 8GBQ6_K · 1.2 t/s
- Intel Arc A580 8GBQ6_K · 1.2 t/s
- Intel Arc A380 6GBQ6_K · 1.1 t/s
- Intel Arc A310 4GBQ5_K_M · 1.1 t/s
- Intel Arc Pro A60 12GBQ6_K · 1.4 t/s
- Intel Arc Pro A50 6GBQ6_K · 1.1 t/s
- Intel Arc Pro A40 6GBQ6_K · 1.1 t/s
- CPU only (system RAM)Q5_K_M · 1.6 t/s
Notes
Supports thinking (chain-of-thought) and non-thinking modes.
Compare Qwen3 32B with other models
- Qwen3 32BvsLlama 3.3 70B Instruct70B params
- Qwen3 32BvsQwen 3.6 27B27B params
- Qwen3 32BvsDeepSeek R1 Distill Qwen 32B32.5B params
- Qwen3 32BvsCommand-R 35B35B params
- Qwen3 32BvsDeepSeek R1 Distill Qwen 32B32.5B params
- Qwen3 32BvsQwen 2.5 Coder 32B Instruct32.5B params
- Qwen3 32BvsQwen3 30B-A3B (MoE)30B params
Continue reading
Frequently asked questions
- What are the VRAM requirements for Qwen3 32B?
- Qwen3 32B requires approximately 23.9 GB of VRAM at Q4_K_M quantization, 40.5 GB at Q8, and 75.0 GB at FP16. These numbers assume 8k context window; VRAM scales linearly with context length due to the KV cache.
- How many parameters does Qwen3 32B have?
- Qwen3 32B has 32.8 billion parameters.
- How capable is Qwen3 32B?
- With an MMLU-Pro score of 65.54, Qwen3 32B delivers solid general-purpose performance suitable for most everyday tasks and professional use.
- Can Qwen3 32B run on a 16 GB GPU?
- No. At Q4_K_M, Qwen3 32B needs 23.9 GB of VRAM, more than 16 GB. You will need a 32 GB GPU like the RTX 5090.
- Can Qwen3 32B run on a 24 GB GPU?
- No. Even at Q4_K_M, Qwen3 32B needs 23.9 GB. Consider a 32 GB card like the RTX 5090.
- What is the smallest quantization for Qwen3 32B that fits in 24 GB of VRAM?
- At NVFP4, Qwen3 32B needs 19.9 GB, the highest-quality quantization that fits in 24 GB of VRAM.
- What GPU do I need to run Qwen3 32B locally?
- A 32 GB GPU is the minimum. At Q4_K_M, Qwen3 32B needs 23.9 GB VRAM. Good option: RTX 5090 (32 GB).