Coding LLMs
16models · local AI VRAM requirements & GPU compatibility
Coding-focused open-weight models excel at code generation, debugging, refactoring, and technical documentation. These models are optimized for instruction-following on programming tasks, often scoring high on HumanEval and similar benchmarks. Because you need quick iteration, tokens/sec matters — pair each model with a GPU that fits it in VRAM for fastest generation.
- Kimi K3Moonshot AI · 2800B params (104B active)1910.3 GBQ4_K_M
- MiMo V2.5 ProXiaomi · 1020B params (42B active)699.7 GBQ4_K_M
- Kimi K2.5Moonshot AI · 1000B params (32B active)683.2 GBQ4_K_M
- InklingThinking Machines Lab · 975B params (41B active)667.5 GBQ4_K_M
- GLM-5.1 754BZ.ai · 754B params (44B active)526.0 GBQ4_K_M
- GLM-5.2 753BZ.ai · 753B params (40B active)525.3 GBQ4_K_M
- Nemotron 3 Ultra 550B-A55BNVIDIA · 550B params (55B active)376.2 GBQ4_K_M
- MiniMax M3MiniMax · 428B params (23B active)293.1 GBQ4_K_M
- GLM-4.5 355BZ.ai · 355B params (32B active)245.6 GBQ4_K_M
- GLM-4.6 355BZ.ai · 355B params (32B active)245.6 GBQ4_K_M
- MiniMax M2.5 229BMiniMax · 229B params (10B active)158.5 GBQ4_K_M
- MiniMax M2.7 229BMiniMax · 229B params (10B active)158.5 GBQ4_K_M
- Step 3.7 FlashStepFun · 198B params (11B active)136.7 GBQ4_K_M
- Step 3.5 FlashStepFun · 196.81B params (11B active)135.9 GBQ4_K_M
- GLM-4.5 Air 106BZ.ai · 106B params (12B active)74.0 GBQ4_K_Mfits 80 GB
- Qwen 2.5 Coder 32B InstructAlibaba · 32.5B params24.6 GBQ4_K_Mfits 48 GB
Want to check your specific GPU? Use the homepage calculator to see which of these models fit your hardware with estimated tokens per second.