Qwen 3.5 35B-A3B (MoE) vs Qwen3 30B-A3B (MoE)

Side-by-side VRAM requirements, benchmark scores, and GPU compatibility for local AI inference.

Quick verdict

Qwen3 30B-A3B (MoE) is more hardware-efficient: it needs 21.4 GB at its Q4_K_M build vs 24.1 GB for Qwen 3.5 35B-A3B (MoE)'s Q4_K_M, fitting on 84 GPUs natively.

VRAM at each quantization (8k context)

FP32
Qwen 3.5 35B-A3B (MoE)
157.0 GB
Qwen3 30B-A3B (MoE)
135.3 GB
BF16
Qwen 3.5 35B-A3B (MoE)
78.6 GB
Qwen3 30B-A3B (MoE)
68.1 GB
FP16
Qwen 3.5 35B-A3B (MoE)
78.6 GB
Qwen3 30B-A3B (MoE)
68.1 GB
Q8_0
Qwen 3.5 35B-A3B (MoE)
41.9 GB
Qwen3 30B-A3B (MoE)
36.6 GB
Q6_K
Qwen 3.5 35B-A3B (MoE)
32.4 GB
Qwen3 30B-A3B (MoE)
28.5 GB
Q5_K_M
Qwen 3.5 35B-A3B (MoE)
28.1 GB
Qwen3 30B-A3B (MoE)
24.8 GB
Q4_K_M
Qwen 3.5 35B-A3B (MoE)
24.1 GB
Qwen3 30B-A3B (MoE)
21.4 GB
Q3_K_M
Qwen 3.5 35B-A3B (MoE)
19.0 GB
Qwen3 30B-A3B (MoE)
17.1 GB
Q2_K
Qwen 3.5 35B-A3B (MoE)
15.1 GB
Qwen3 30B-A3B (MoE)
13.7 GB
NVFP4
Qwen 3.5 35B-A3B (MoE)
19.8 GB
Qwen3 30B-A3B (MoE)
17.7 GB
QuantQwen 3.5 35B-A3B (MoE)Qwen3 30B-A3B (MoE)Diff
FP32157.0 GB135.3 GB+16%
BF1678.6 GB68.1 GB+15%
FP1678.6 GB68.1 GB+15%
Q8_041.9 GB36.6 GB+14%
Q6_K32.4 GB28.5 GB+14%
Q5_K_M28.1 GB24.8 GB+13%
Q4_K_M24.1 GB21.4 GB+13%
Q3_K_M19.0 GB17.1 GB+12%
Q2_K15.1 GB13.7 GB+10%
NVFP419.8 GB17.7 GB+12%

Diff is Qwen 3.5 35B-A3B (MoE) relative to Qwen3 30B-A3B (MoE). Green = lower VRAM (fits more GPUs).

Model specifications

SpecQwen 3.5 35B-A3B (MoE)Qwen3 30B-A3B (MoE)
OrgAlibabaAlibaba
Parameters35B30B
ArchitectureMoE (3B active)MoE (3B active)
Context256k tokens128k tokens
Modalitiestext, vision, videotext
LicenseApache 2.0Apache 2.0
CommercialYesYes
Released2026-02-242025-04-29
GPUs (native)84 / 11984 / 119

Benchmark scores

BenchmarkQwen 3.5 35B-A3B (MoE)Qwen3 30B-A3B (MoE)
MMLU-Pro85.361.5
GPQA Diamond84.2N/A
SWE-bench Verified69.2N/A

Green = higher score (better). N/A = not yet available. ~ = inherited from a base model, not independently reported for that release itself.

GPUs that run only Qwen 3.5 35B-A3B (MoE)(0)

Every GPU that runs Qwen 3.5 35B-A3B (MoE) also runs Qwen3 30B-A3B (MoE).

GPUs that run only Qwen3 30B-A3B (MoE)(0)

Every GPU that runs Qwen3 30B-A3B (MoE) also runs Qwen 3.5 35B-A3B (MoE).

GPUs that run both natively(84)

Which should you use?

Choose Qwen 3.5 35B-A3B (MoE) if:
  • You want maximum capability and have a 25 GB+ GPU
  • Long context matters: it supports 256k tokens vs 128k
  • Benchmark quality matters: scores 85.3 vs 61.5 on MMLU-Pro
  • You need vision/image understanding
  • It's the newer release (2026-02-24 vs 2025-04-29); check the benchmark table above for what actually improved
Choose Qwen3 30B-A3B (MoE) if:
  • You have limited VRAM: it's a smaller model needing 21.4 GB vs 24.1 GB

Frequently asked questions

Which is better, Qwen 3.5 35B-A3B (MoE) or Qwen3 30B-A3B (MoE)?
Qwen 3.5 35B-A3B (MoE) has 35B parameters vs 30B for Qwen3 30B-A3B (MoE), so Qwen 3.5 35B-A3B (MoE) is the larger model. Qwen3 30B-A3B (MoE) is more hardware-efficient, needing 21.4 GB at its Q4_K_M build vs 24.1 GB for Qwen 3.5 35B-A3B (MoE)'s Q4_K_M. On MMLU-Pro, Qwen 3.5 35B-A3B (MoE) scores higher (85.3 vs 61.5).
How much VRAM does Qwen 3.5 35B-A3B (MoE) need vs Qwen3 30B-A3B (MoE)?
At 8k context, Qwen 3.5 35B-A3B (MoE) needs approximately 24.1 GB of VRAM at its Q4_K_M build, while Qwen3 30B-A3B (MoE) needs 21.4 GB at its Q4_K_M build. At the largest build each ships, Qwen 3.5 35B-A3B (MoE) requires 78.6 GB (FP16) vs 68.1 GB (FP16) for Qwen3 30B-A3B (MoE).
Can you run Qwen 3.5 35B-A3B (MoE) on the same GPUs as Qwen3 30B-A3B (MoE)?
Yes, 84 GPUs can run both natively in VRAM, including NVIDIA RTX 5090, NVIDIA RTX 5080, NVIDIA RTX 5070 Ti. However, no GPU can run Qwen 3.5 35B-A3B (MoE) without also fitting Qwen3 30B-A3B (MoE), and no GPU can run Qwen3 30B-A3B (MoE) without also fitting Qwen 3.5 35B-A3B (MoE).
What is the difference between Qwen 3.5 35B-A3B (MoE) and Qwen3 30B-A3B (MoE)?
Qwen 3.5 35B-A3B (MoE) has 35B parameters (3B active, MoE) with a 256k context window. Qwen3 30B-A3B (MoE) has 30B parameters (3B active, MoE) with a 128k context window.
Which model fits in 24 GB of VRAM, Qwen 3.5 35B-A3B (MoE) or Qwen3 30B-A3B (MoE)?
Only Qwen3 30B-A3B (MoE) fits in 24 GB, at its Q4_K_M build (21.4 GB). Qwen 3.5 35B-A3B (MoE) needs 24.1 GB at Q4_K_M, requiring a larger GPU.
Full Qwen 3.5 35B-A3B (MoE) page →Full Qwen3 30B-A3B (MoE) page →Check your hardware →