Coding LLMs
32models · local AI VRAM requirements & GPU compatibility
Coding-focused open-weight models excel at code generation, debugging, refactoring, and technical documentation. These models are optimized for instruction-following on programming tasks, often scoring high on HumanEval and similar benchmarks. Because you need quick iteration, tokens/sec matters, so pair each model with a GPU that fits it in VRAM for fastest generation.
- Kimi K3Moonshot AI · 2800B params (104B active)1910.3 GBQ4_K_M
- Qwen3.8 2.4T-A95BAlibaba · 2446.18B params (95B active)1669.3 GBQ4_K_M
- MiMo V2.5 ProXiaomi · 1020B params (42B active)699.7 GBQ4_K_M
- Kimi K2.5Moonshot AI · 1000B params (32B active)683.2 GBQ4_K_M
- InklingThinking Machines Lab · 975B params (41B active)667.5 GBQ4_K_M
- GLM-5.1 754BZ.ai · 754B params (44B active)526.0 GBQ4_K_M
- GLM-5.2 753BZ.ai · 753B params (40B active)515.1 GBQ4_K_M
- GLM-5.3 753BZ.ai · 753B params (40B active)515.1 GBQ4_K_M
- DeepSeek V4.1 Flash 552BDeepSeek · 552B params (16B active)571.6 GBQ4_K_M
- Nemotron 3 Ultra 550B-A55BNVIDIA · 550B params (55B active)376.2 GBQ4_K_M
- MiniMax M3MiniMax · 428B params (23B active)293.1 GBQ4_K_M
- Ornith 1.5 397B (MoE)Ornith AI · 396.8B params (14B active)270.9 GBQ4_K_M
- GLM-4.7 358BZ.ai · 358B params (32B active)247.6 GBQ4_K_M
- GLM-4.5 355BZ.ai · 355B params (32B active)245.6 GBQ4_K_M
- GLM-4.6 355BZ.ai · 355B params (32B active)245.6 GBQ4_K_M
- GLM-5.3-Flash 320BZ.ai · 320B params (18B active)218.5 GBQ4_K_M
- DeepSeek V4 Flash 0731 284BDeepSeek · 284B params (13B active)92.5 GBQ4_K_M
- MiniMax M2.5 229BMiniMax · 229B params (10B active)158.5 GBQ4_K_M
- MiniMax M2.7 229BMiniMax · 229B params (10B active)158.5 GBQ4_K_M
- Step 3.7 FlashStepFun · 198B params (11B active)136.7 GBQ4_K_M
- Step 3.5 FlashStepFun · 196.81B params (11B active)135.9 GBQ4_K_M
- Qwen3.8-Flash-NextAlibaba · 180B params (6B active)123.0 GBQ4_K_M
- Mistral Medium 3.5 128BMistral AI · 128B params90.6 GBQ4_K_M
- GLM-4.5 Air 106BZ.ai · 106B params (12B active)74.0 GBQ4_K_Mfits 80 GB
- Ornith 1.5 35B-A3B (MoE)Ornith AI · 35B params (3B active)24.1 GBQ4_K_Mfits 32 GB
- Qwen 2.5 Coder 32B InstructAlibaba · 32.5B params24.6 GBQ4_K_Mfits 32 GB
- Gemma 4 31BGoogle · 30.7B params22.6 GBQ4_K_Mfits 24 GB
- Nemotron 3.5 Lightning 30B-A3BNVIDIA · 30B params (3B active)20.5 GBQ4_K_Mfits 24 GB
- Muse Glimmer 30BMeta · 27.8B params19.2 GBQ4_K_Mfits 24 GB
- Qwen 3.6 27BAlibaba · 27B params19.0 GBQ4_K_Mfits 24 GB
- Qwen 3.8 27BAlibaba · 27B params19.0 GBQ4_K_Mfits 24 GB
- Ornith 1.5 9BOrnith AI · 9B params6.4 GBQ4_K_Mfits 8 GB
Want to check your specific GPU? Use the homepage calculator to see which of these models fit your hardware with estimated tokens per second.