Multimodal LLMs
35models · local AI VRAM requirements & GPU compatibility
Multimodal models understand images, audio, or video in addition to text. Running them locally requires the same VRAM as their text-only counterparts for the language backbone, plus additional memory for the vision encoder during inference. Check each model page for the exact VRAM breakdown.
- Kimi K3Moonshot AI · 2800B params (104B active)1910.3 GBQ4_K_M
- DeepSeek V4 Pro 1.6TDeepSeek · 1600B params (49B active)1091.4 GBQ4_K_M
- Kimi K2.6Moonshot AI · 1000B params (32B active)685.1 GBQ4_K_M
- Kimi K2.5Moonshot AI · 1000B params (32B active)683.2 GBQ4_K_M
- InklingThinking Machines Lab · 975B params (41B active)667.5 GBQ4_K_M
- DeepSeek V4.1 Flash 552BDeepSeek · 552B params (16B active)571.6 GBQ4_K_M
- MiniMax M3MiniMax · 428B params (23B active)293.1 GBQ4_K_M
- Llama 4 Maverick 400BMeta · 400B params (17B active)277.3 GBQ4_K_M
- Ornith 1.5 397B (MoE)Ornith AI · 396.8B params (14B active)270.9 GBQ4_K_M
- GLM-5.3-Flash 320BZ.ai · 320B params (18B active)218.5 GBQ4_K_M
- Step 3.7 FlashStepFun · 198B params (11B active)136.7 GBQ4_K_M
- Qwen3.8-Flash-NextAlibaba · 180B params (6B active)123.0 GBQ4_K_M
- Mistral Medium 3.5 128BMistral AI · 128B params90.6 GBQ4_K_M
- Qwen 3.5 122B-A10B (MoE)Alibaba · 122B params (10B active)83.4 GBQ4_K_M
- Llama 4 Scout 109BMeta · 109B params (17B active)77.3 GBQ4_K_M
- GLM-4.6V 106BZ.ai · 106B params (12B active)74.0 GBQ4_K_Mfits 80 GB
- Qwen 3.5 35B-A3B (MoE)Alibaba · 35B params (3B active)24.1 GBQ4_K_Mfits 32 GB
- Ornith 1.5 35B-A3B (MoE)Ornith AI · 35B params (3B active)24.1 GBQ4_K_Mfits 32 GB
- Gemma 4 31BGoogle · 30.7B params22.6 GBQ4_K_Mfits 24 GB
- Muse Glimmer 30BMeta · 27.8B params19.2 GBQ4_K_Mfits 24 GB
- Gemma 3 27B InstructGoogle · 27B params20.1 GBQ4_K_Mfits 24 GB
- Qwen 3.6 27BAlibaba · 27B params19.0 GBQ4_K_Mfits 24 GB
- UI-Mate 27BTencent · 27B params19.0 GBQ4_K_Mfits 24 GB
- Bonsai 27BPrismML · 27B params4.9 GBQ4_K_Mfits 8 GB
- Bonsai 2 27BPrismML · 27B params7.2 GBQ4_K_Mfits 8 GB
- Qwen 3.8 27BAlibaba · 27B params19.0 GBQ4_K_Mfits 24 GB
- Gemma 4 26B (MoE)Google · 25.2B params (3.8B active)17.6 GBQ4_K_Mfits 24 GB
- Mistral Small 3.1 24B InstructMistral AI · 24B params17.9 GBQ4_K_Mfits 24 GB
- Gemma 3 12B InstructGoogle · 12.2B params9.5 GBQ4_K_Mfits 12 GB
- Gemma 4 12B (Unified)Google · 12B params11.8 GBQ4_K_Mfits 16 GB
- Qwen 3.5 9BAlibaba · 9B params6.4 GBQ4_K_Mfits 8 GB
- Ornith 1.5 9BOrnith AI · 9B params6.4 GBQ4_K_Mfits 8 GB
- Gemma 3 4B InstructGoogle · 4B params3.3 GBQ4_K_Mfits 8 GB
- Gemma 4 E4BGoogle · 4B params3.9 GBQ4_K_Mfits 8 GB
- Gemma 4 E2BGoogle · 2B params1.8 GBQ4_K_Mfits 8 GB
Want to check your specific GPU? Use the homepage calculator to see which of these models fit your hardware with estimated tokens per second.