Home › Best › best LLM for 16GB VRAM The best open LLMs you can run on 16 GB of VRAM Open LLMs calculated to need no more than 16 GB of VRAM at the stated default quant and context — the RTX 4060 Ti 16 GB, 4070 Ti Super, or 16 GB Mac tier. Ranked by popularity within that calculated fit set. Verify the selected build, available memory, and context on your exact machine.
How this is ranked: Transparent calculated filter: 'best' = 'estimated to fit a 16 GB budget at the stated quant and context.' Ordering is by popularity/recognition, not a subjective quality verdict; runner overhead can change actual memory use.
1. Llama 3.1 8B Instruct — Meta, 8B · ~8.0 GB VRAM · $0.07/1M API · commercial OK2. Qwen2.5 7B Instruct — Alibaba, 7B · ~7.0 GB VRAM · $0.15/1M API · commercial OK3. Qwen3 0.6B — Qwen, 800M · ~3.0 GB VRAM · $0.11/1M API est. · commercial OK4. Mistral 7B Instruct v0.3 — Mistral AI, 7.2B · ~8.0 GB VRAM · $0.20/1M API · commercial OK5. Qwen2.5-Coder 7B Instruct — Alibaba, 7B · ~7.0 GB VRAM · $0.16/1M API est. · commercial OK6. gpt-oss-20b — OpenAI, 21B · ~15 GB VRAM · $0.08/1M API · commercial OK7. Qwen3 4B — Qwen, 4B · ~5.0 GB VRAM · $0.13/1M API est. · commercial OK8. Qwen2.5 3B Instruct — Qwen, 3.1B · ~4.0 GB VRAM · $0.12/1M API est. · non-commercial9. Gemma 2 9B Instruct — Google, 9B · ~9.0 GB VRAM · $0.06/1M API · commercial OK10. Llama 3.2 3B Instruct — Meta, 3B · ~5.0 GB VRAM · $0.19/1M API · commercial OK11. Qwen2.5 1.5B Instruct — Qwen, 1.5B · ~3.0 GB VRAM · $0.11/1M API est. · commercial OK12. gemma 3 270m — google, 300M · ~2.0 GB VRAM · $0.10/1M API est. · commercial OK13. Phi-4 — Microsoft, 14B · ~13 GB VRAM · $0.11/1M API · commercial OK14. Qwen3-8B — Alibaba, 8.2B · ~9.0 GB VRAM · $0.29/1M API · commercial OK15. Gemma 3 12B — Google, 12B · ~13 GB VRAM · $0.10/1M API · commercial OK16. Qwen3 1.7B — Qwen, 2B · ~5.0 GB VRAM · $0.12/1M API est. · commercial OK17. BGE-M3 — BAAI, 567M · ~3.0 GB VRAM · $0.10/1M API est. · commercial OK18. Qwen3 4B Instruct 2507 — Qwen, 4B · ~5.0 GB VRAM · $0.13/1M API est. · commercial OK19. Qwen2.5 0.5B Instruct — Qwen, 500M · ~2.0 GB VRAM · $0.10/1M API est. · commercial OK20. Qwen2.5 Coder 14B Instruct — Qwen, 14.8B · ~14 GB VRAM · $0.22/1M API est. · commercial OK21. Qwen2 1.5B Instruct — Qwen, 1.5B · ~3.0 GB VRAM · $0.11/1M API est. · commercial OK22. Llama 3.2 1B Instruct — Meta, 1.2B · ~3.0 GB VRAM · $0.11/1M API · commercial OK23. Llama 3.2 1B — meta-llama, 1.2B · ~3.0 GB VRAM · $0.11/1M API est. · commercial OK24. Qwen2.5 0.5B — Qwen, 500M · ~2.0 GB VRAM · $0.10/1M API est. · commercial OK25. Phi-3.5-mini Instruct — Microsoft, 3.8B · ~5.0 GB VRAM · $0.13/1M API est. · commercial OK26. Qwen2-VL 7B Instruct — Alibaba, 8B · ~7.0 GB VRAM · $0.16/1M API est. · commercial OK27. gemma 3 1b it — google, 1B · ~3.0 GB VRAM · $0.11/1M API est. · commercial OK28. Qwen2.5 14B Instruct — Qwen, 14.8B · ~14 GB VRAM · $0.22/1M API est. · commercial OK29. TinyLlama 1.1B Chat v1.0 — TinyLlama, 1.1B · ~2.0 GB VRAM · $0.11/1M API est. · commercial OK30. Rio 3.0 Open Mini — prefeitura-rio, 4B · ~5.0 GB VRAM · $0.13/1M API est. · commercial OK31. Qwen3 14B — Qwen, 14.8B · ~13 GB VRAM · $0.18/1M API · commercial OK32. gpt2 large — openai-community, 800M · ~2.0 GB VRAM · $0.11/1M API est. · commercial OK33. OpenELM 1 1B Instruct — apple, 1.1B · ~3.0 GB VRAM · $0.11/1M API est. · non-commercial34. DeepSeek-Coder-V2-Lite Instruct — DeepSeek, 15.7B · ~11 GB VRAM · $0.23/1M API est. · commercial OK35. Hermes 3 — Llama 3.1 8B — Nous Research, 8B · ~8.0 GB VRAM · $0.16/1M API est. · commercial OK36. PowerMoE 3b — ibm-research, 3.4B · ~4.0 GB VRAM · $0.13/1M API est. · commercial OK37. Meta Llama 3 8B Instruct — meta-llama, 8B · ~10 GB VRAM · $0.16/1M API est. · commercial OK38. Mistral 7B Instruct v0.2 — mistralai, 7.2B · ~8.0 GB VRAM · $0.16/1M API est. · commercial OK39. Llama 3.1 8B — meta-llama, 8B · ~10 GB VRAM · $0.16/1M API est. · commercial OK40. Meta Llama 3 8B — meta-llama, 8B · ~10 GB VRAM · $0.16/1M API est. · commercial OKShowing the top 40 of 380. See all →
Want every model that fits? All 380 models that run on 16 GB of VRAM →
More: all "best" lists · Outcome Lab · all models
Open the free LLM cost calculator → · $0 markup. © 2026 Cynosure LLC.