Home › Best › best LLM for 24GB VRAM The best open LLMs you can run on 24 GB of VRAM Open LLMs calculated to need no more than 24 GB of VRAM at the stated default quant and context — the RTX 3090, 4090, and 7900 XTX tier. Ranked by popularity within that calculated fit set, with local and rented-GPU cost estimates. Verify the selected build and context on your exact machine.
How this is ranked: Transparent calculated fit filter. 'Best' means 'estimated to run within a 24 GB VRAM budget at the stated quant and context.' Ordering is by popularity/recognition, never a quality verdict; actual usage depends on runner overhead and settings.
1. Llama 3.1 8B Instruct — Meta, 8B · ~8.0 GB VRAM · $0.07/1M API · commercial OK2. Qwen2.5 7B Instruct — Alibaba, 7B · ~7.0 GB VRAM · $0.15/1M API · commercial OK3. Qwen3 0.6B — Qwen, 800M · ~3.0 GB VRAM · $0.11/1M API est. · commercial OK4. Mistral 7B Instruct v0.3 — Mistral AI, 7.2B · ~8.0 GB VRAM · $0.20/1M API · commercial OK5. Qwen2.5-Coder 7B Instruct — Alibaba, 7B · ~7.0 GB VRAM · $0.16/1M API est. · commercial OK6. gpt-oss-20b — OpenAI, 21B · ~15 GB VRAM · $0.08/1M API · commercial OK7. Qwen3 4B — Qwen, 4B · ~5.0 GB VRAM · $0.13/1M API est. · commercial OK8. Qwen2.5 3B Instruct — Qwen, 3.1B · ~4.0 GB VRAM · $0.12/1M API est. · non-commercial9. Gemma 2 9B Instruct — Google, 9B · ~9.0 GB VRAM · $0.06/1M API · commercial OK10. Llama 3.2 3B Instruct — Meta, 3B · ~5.0 GB VRAM · $0.19/1M API · commercial OK11. Qwen2.5 1.5B Instruct — Qwen, 1.5B · ~3.0 GB VRAM · $0.11/1M API est. · commercial OK12. gemma 3 270m — google, 300M · ~2.0 GB VRAM · $0.10/1M API est. · commercial OK13. Phi-4 — Microsoft, 14B · ~13 GB VRAM · $0.11/1M API · commercial OK14. Qwen3-8B — Alibaba, 8.2B · ~9.0 GB VRAM · $0.29/1M API · commercial OK15. Gemma 3 12B — Google, 12B · ~13 GB VRAM · $0.10/1M API · commercial OK16. Qwen3 1.7B — Qwen, 2B · ~5.0 GB VRAM · $0.12/1M API est. · commercial OK17. Gemma 2 27B Instruct — Google, 27B · ~22 GB VRAM · $0.65/1M API · commercial OK18. BGE-M3 — BAAI, 567M · ~3.0 GB VRAM · $0.10/1M API est. · commercial OK19. Mistral Small 3 (24B, 2501) — Mistral AI, 23.6B · ~20 GB VRAM · $0.07/1M API · commercial OK20. Qwen3 4B Instruct 2507 — Qwen, 4B · ~5.0 GB VRAM · $0.13/1M API est. · commercial OK21. Qwen2.5 0.5B Instruct — Qwen, 500M · ~2.0 GB VRAM · $0.10/1M API est. · commercial OK22. Qwen2.5 Coder 14B Instruct — Qwen, 14.8B · ~14 GB VRAM · $0.22/1M API est. · commercial OK23. Qwen2 1.5B Instruct — Qwen, 1.5B · ~3.0 GB VRAM · $0.11/1M API est. · commercial OK24. Llama 3.2 1B Instruct — Meta, 1.2B · ~3.0 GB VRAM · $0.11/1M API · commercial OK25. Llama 3.2 1B — meta-llama, 1.2B · ~3.0 GB VRAM · $0.11/1M API est. · commercial OK26. Qwen2.5 0.5B — Qwen, 500M · ~2.0 GB VRAM · $0.10/1M API est. · commercial OK27. Phi-3.5-mini Instruct — Microsoft, 3.8B · ~5.0 GB VRAM · $0.13/1M API est. · commercial OK28. Qwen2-VL 7B Instruct — Alibaba, 8B · ~7.0 GB VRAM · $0.16/1M API est. · commercial OK29. gemma 3 1b it — google, 1B · ~3.0 GB VRAM · $0.11/1M API est. · commercial OK30. Qwen3 30B A3B — Qwen, 30.5B · ~22 GB VRAM · $0.31/1M API · commercial OK31. Qwen2.5 14B Instruct — Qwen, 14.8B · ~14 GB VRAM · $0.22/1M API est. · commercial OK32. TinyLlama 1.1B Chat v1.0 — TinyLlama, 1.1B · ~2.0 GB VRAM · $0.11/1M API est. · commercial OK33. Rio 3.0 Open Mini — prefeitura-rio, 4B · ~5.0 GB VRAM · $0.13/1M API est. · commercial OK34. Qwen3.6 35B A3B NVFP4 — nvidia, 18.7B · ~22 GB VRAM · $0.25/1M API est. · commercial OK35. Qwen3 14B — Qwen, 14.8B · ~13 GB VRAM · $0.18/1M API · commercial OK36. gpt2 large — openai-community, 800M · ~2.0 GB VRAM · $0.11/1M API est. · commercial OK37. Qwen3 Coder 30B A3B Instruct — Qwen, 30.5B · ~22 GB VRAM · $0.18/1M API · commercial OK38. NVIDIA Nemotron 3 Nano 30B A3B BF16 — nvidia, 31.6B · ~22 GB VRAM · $0.35/1M API est. · non-commercial39. OpenELM 1 1B Instruct — apple, 1.1B · ~3.0 GB VRAM · $0.11/1M API est. · non-commercial40. DeepSeek-Coder-V2-Lite Instruct — DeepSeek, 15.7B · ~11 GB VRAM · $0.23/1M API est. · commercial OKShowing the top 40 of 426. See all →
Want every model that fits? All 426 models that run on 24 GB of VRAM →
More: all "best" lists · Outcome Lab · all models
Open the free LLM cost calculator → · $0 markup. © 2026 Cynosure LLC.