Qwen 3.5 35B-A3B (MoE) vs Qwen 3.5 122B-A10B (MoE)
Side-by-side VRAM requirements, benchmark scores, and GPU compatibility for local AI inference.
Quick verdict
Qwen 3.5 35B-A3B (MoE) is more hardware-efficient: it needs 24.1 GB at its Q4_K_M build vs 83.4 GB for Qwen 3.5 122B-A10B (MoE)'s Q4_K_M, fitting on 84 GPUs natively.
VRAM at each quantization (8k context)
FP32
Qwen 3.5 35B-A3B (MoE)
157.0 GB
Qwen 3.5 122B-A10B (MoE)
546.8 GB
BF16
Qwen 3.5 35B-A3B (MoE)
78.6 GB
Qwen 3.5 122B-A10B (MoE)
273.5 GB
FP16
Qwen 3.5 35B-A3B (MoE)
78.6 GB
Qwen 3.5 122B-A10B (MoE)
273.5 GB
Q8_0
Qwen 3.5 35B-A3B (MoE)
41.9 GB
Qwen 3.5 122B-A10B (MoE)
145.5 GB
Q6_K
Qwen 3.5 35B-A3B (MoE)
32.4 GB
Qwen 3.5 122B-A10B (MoE)
112.4 GB
Q5_K_M
Qwen 3.5 35B-A3B (MoE)
28.1 GB
Qwen 3.5 122B-A10B (MoE)
97.5 GB
Q4_K_M
Qwen 3.5 35B-A3B (MoE)
24.1 GB
Qwen 3.5 122B-A10B (MoE)
83.4 GB
Q3_K_M
Qwen 3.5 35B-A3B (MoE)
19.0 GB
Qwen 3.5 122B-A10B (MoE)
66.0 GB
Q2_K
Qwen 3.5 35B-A3B (MoE)
15.1 GB
Qwen 3.5 122B-A10B (MoE)
52.3 GB
NVFP4
Qwen 3.5 35B-A3B (MoE)
19.8 GB
Qwen 3.5 122B-A10B (MoE)
68.5 GB
| Quant | Qwen 3.5 35B-A3B (MoE) | Qwen 3.5 122B-A10B (MoE) | Diff |
|---|---|---|---|
| FP32 | 157.0 GB | 546.8 GB | -71% |
| BF16 | 78.6 GB | 273.5 GB | -71% |
| FP16 | 78.6 GB | 273.5 GB | -71% |
| Q8_0 | 41.9 GB | 145.5 GB | -71% |
| Q6_K | 32.4 GB | 112.4 GB | -71% |
| Q5_K_M | 28.1 GB | 97.5 GB | -71% |
| Q4_K_M | 24.1 GB | 83.4 GB | -71% |
| Q3_K_M | 19.0 GB | 66.0 GB | -71% |
| Q2_K | 15.1 GB | 52.3 GB | -71% |
| NVFP4 | 19.8 GB | 68.5 GB | -71% |
Diff is Qwen 3.5 35B-A3B (MoE) relative to Qwen 3.5 122B-A10B (MoE). Green = lower VRAM (fits more GPUs).
Model specifications
| Spec | Qwen 3.5 35B-A3B (MoE) | Qwen 3.5 122B-A10B (MoE) |
|---|---|---|
| Org | Alibaba | Alibaba |
| Parameters | 35B | 122B |
| Architecture | MoE (3B active) | MoE (10B active) |
| Context | 256k tokens | 256k tokens |
| Modalities | text, vision, video | text, vision, video |
| License | Apache 2.0 | Apache 2.0 |
| Commercial | Yes | Yes |
| Released | 2026-02-24 | 2026-02-15 |
| GPUs (native) | 84 / 119 | 33 / 119 |
Benchmark scores
| Benchmark | Qwen 3.5 35B-A3B (MoE) | Qwen 3.5 122B-A10B (MoE) |
|---|---|---|
| MMLU-Pro | 85.3 | 86.7 |
| GPQA Diamond | 84.2 | 86.6 |
| SWE-bench Verified | 69.2 | 72.0 |
Green = higher score (better). N/A = not yet available. ~ = inherited from a base model, not independently reported for that release itself.
GPUs that run only Qwen 3.5 35B-A3B (MoE)(51)
- NVIDIA RTX 509032 GB
- NVIDIA RTX 508016 GB
- NVIDIA RTX 5070 Ti16 GB
- NVIDIA RTX 5060 Ti 16GB16 GB
- NVIDIA RTX 409024 GB
- NVIDIA RTX 408016 GB
- NVIDIA RTX 4070 Ti SUPER16 GB
- NVIDIA RTX 4060 Ti 16GB16 GB
- NVIDIA RTX 309024 GB
- NVIDIA RTX 3090 Ti24 GB
- +41 more
GPUs that run only Qwen 3.5 122B-A10B (MoE)(0)
Every GPU that runs Qwen 3.5 122B-A10B (MoE) also runs Qwen 3.5 35B-A3B (MoE).
GPUs that run both natively(33)
- NVIDIA B300 288GB288 GB
- NVIDIA B200 180GB180 GB
- NVIDIA H200 141GB141 GB
- NVIDIA H100 80GB80 GB
- NVIDIA A100 80GB80 GB
- NVIDIA RTX Pro 600096 GB
- NVIDIA DGX Spark (128GB)128 GB
- AMD Instinct MI300X192 GB
- AMD Strix Halo (128GB)128 GB
- AMD Strix Halo (96GB)96 GB
- AMD Strix Halo (64GB)64 GB
- Apple M5 Ultra (512GB)512 GB
- +21 more GPUs run both
Which should you use?
Choose Qwen 3.5 35B-A3B (MoE) if:
- • You have limited VRAM: it's a smaller model needing 24.1 GB vs 83.4 GB
- • It's the newer release (2026-02-24 vs 2026-02-15); check the benchmark table above for what actually improved
Choose Qwen 3.5 122B-A10B (MoE) if:
- • You want maximum capability and have a 84 GB+ GPU
- • Benchmark quality matters: scores 86.7 vs 85.3 on MMLU-Pro
Frequently asked questions
- Which is better, Qwen 3.5 35B-A3B (MoE) or Qwen 3.5 122B-A10B (MoE)?
- Qwen 3.5 35B-A3B (MoE) has 35B parameters vs 122B for Qwen 3.5 122B-A10B (MoE), so Qwen 3.5 122B-A10B (MoE) is the larger model. Qwen 3.5 35B-A3B (MoE) is more hardware-efficient, needing 24.1 GB at its Q4_K_M build vs 83.4 GB for Qwen 3.5 122B-A10B (MoE)'s Q4_K_M. Qwen 3.5 35B-A3B (MoE) runs on more GPUs natively (84 vs 33). On MMLU-Pro, Qwen 3.5 122B-A10B (MoE) scores higher (86.7 vs 85.3).
- How much VRAM does Qwen 3.5 35B-A3B (MoE) need vs Qwen 3.5 122B-A10B (MoE)?
- At 8k context, Qwen 3.5 35B-A3B (MoE) needs approximately 24.1 GB of VRAM at its Q4_K_M build, while Qwen 3.5 122B-A10B (MoE) needs 83.4 GB at its Q4_K_M build. At the largest build each ships, Qwen 3.5 35B-A3B (MoE) requires 78.6 GB (FP16) vs 273.5 GB (FP16) for Qwen 3.5 122B-A10B (MoE).
- Can you run Qwen 3.5 35B-A3B (MoE) on the same GPUs as Qwen 3.5 122B-A10B (MoE)?
- Yes, 33 GPUs can run both natively in VRAM, including NVIDIA B300 288GB, NVIDIA B200 180GB, NVIDIA H200 141GB. However, 51 GPUs can run Qwen 3.5 35B-A3B (MoE) but not Qwen 3.5 122B-A10B (MoE), and no GPU can run Qwen 3.5 122B-A10B (MoE) without also fitting Qwen 3.5 35B-A3B (MoE).
- What is the difference between Qwen 3.5 35B-A3B (MoE) and Qwen 3.5 122B-A10B (MoE)?
- Qwen 3.5 35B-A3B (MoE) has 35B parameters (3B active, MoE) with a 256k context window. Qwen 3.5 122B-A10B (MoE) has 122B parameters (10B active, MoE) with a 256k context window.
- Which model fits in 24 GB of VRAM, Qwen 3.5 35B-A3B (MoE) or Qwen 3.5 122B-A10B (MoE)?
- Neither fits in 24 GB: Qwen 3.5 35B-A3B (MoE) needs 24.1 GB at Q4_K_M and Qwen 3.5 122B-A10B (MoE) needs 83.4 GB at Q4_K_M. Both require a multi-GPU server with 84 GB+ of combined VRAM.