Home › Models › 24 GB of VRAM What LLMs fit in 24 GB of VRAM? 426 open models are calculated to use no more than 24 GB of VRAM at the stated default quant and context — a budget associated with a high-end card like an RTX 3090 / 4090. Largest first; verify the selected build and runner on your exact machine.
How to choose an LLM for a 24 GB GPU The 426-model list below is a calculated fit inventory, not a quality ranking. Start with fit, verify your exact card and runner, then compare the cost of owning, renting, or using an API.
Test 24 GB against the full catalog .Check RTX 3090 or RTX 4090 fit and cost details. Compare local, rented GPU, and API routes .Memory use changes with quantization, context length, runtime overhead, and the exact model build. A calculated fit is a starting point—not a hardware guarantee.
Laguna XS.2 — 33.4B, poolside · ~24 GB VRAMLaguna XS 2.1 NVFP4 — 33.4B, poolside · ~24 GB VRAMLaguna XS 2.1 — 33.4B, poolside · ~24 GB VRAMsarvam 30b — 32.2B, sarvamai · ~22 GB VRAMllm jp 4 32b a3b thinking — 32.1B, llm-jp · ~23 GB VRAMNVIDIA Nemotron 3 Nano 30B A3B BF16 — 31.6B, nvidia · ~22 GB VRAMNVIDIA Nemotron 3.5 Lightning 30B A3B BF16 — 31.6B, nvidia · ~22 GB VRAMNemotron Cascade 2 30B A3B — 31.6B, nvidia · ~22 GB VRAMFastino Nemotron 3.5 Lightning Healthcare — 31.6B, fastino · ~22 GB VRAMQwen3 30B A3B — 30.5B, Qwen · ~22 GB VRAMQwen3 Coder 30B A3B Instruct — 30.5B, Qwen · ~22 GB VRAMQwen3 30B A3B Instruct 2507 — 30.5B, Qwen · ~22 GB VRAMQwen3 30B A3B abliterated — 30.5B, mlabonne · ~22 GB VRAMQwen3 30B A3B Thinking 2507 — 30.5B, Qwen · ~22 GB VRAMTongyi DeepResearch 30B A3B — 30.5B, Alibaba-NLP · ~22 GB VRAMQwen3 30B A3B Base — 30.5B, Qwen · ~22 GB VRAMlynx instruct 30b — 30.5B, bineric · ~22 GB VRAMNorth Mini Code 1.0 — 30.5B, CohereLabs · ~22 GB VRAMgranite 4.1 30b — 28.9B, ibm-granite · ~24 GB VRAMGemma 2 27B Instruct — 27B, Google · ~22 GB VRAMQwen3.6 27B OBLITERATED — 26.9B, OBLITERATUS · ~22 GB VRAMqwen27B Agent R2 abliterated preview — 26.9B, hotdogs · ~22 GB VRAMTrinity Mini — 26.1B, arcee-ai · ~19 GB VRAMLFM2 24B A2B — 23.8B, LiquidAI · ~18 GB VRAMMistral Small 3 (24B, 2501) — 23.6B, Mistral AI · ~20 GB VRAMEuroLLM 22B Instruct 2512 — 22.6B, utter-project · ~19 GB VRAMsolar pro preview instruct — 22.1B, upstage · ~17 GB VRAMERNIE 4.5 21B A3B Thinking — 21.8B, baidu · ~16 GB VRAMgpt oss safeguard 20b — 21.5B, openai · ~16 GB VRAMgpt-oss-20b — 21B, OpenAI · ~15 GB VRAMgpt oss 20b BF16 — 20.9B, unsloth · ~15 GB VRAMgpt neox 20b — 20.7B, EleutherAI · ~17 GB VRAMQwen3.6 35B A3B abliterated NVFP4 MTP — 20.4B, THe-Plague · ~24 GB VRAMQwen3.6 27B Claude Opus Sonnet Distilled NVFP4 MTP — 19.6B, Brian6145 · ~23 GB VRAMQwen3.6 27B AEON Ultimate Uncensored Multimodal NVFP4 MTP — 19.6B, AEON-7 · ~23 GB VRAMQwen3.6 27B AEON Ultimate Uncensored NVFP4 — 19.1B, AEON-7 · ~23 GB VRAMAgents A1 NVFP4 — 18.9B, r0b0tlab · ~22 GB VRAMQwen3.6 35B A3B NVFP4 — 18.7B, nvidia · ~22 GB VRAMOrnith 1.5 35B A3B NVFP4 — 18.7B, ornith-ai · ~22 GB VRAMGLM 4.7 Flash NVFP4 — 18.4B, GadflyII · ~19 GB VRAMNVIDIA Nemotron 3 Nano 30B A3B NVFP4 — 18.2B, nvidia · ~13 GB VRAMQwen3.6 27B NVFP4 — 18.2B, nvidia · ~21 GB VRAMNVIDIA Nemotron 3.5 Lightning 30B A3B NVFP4 — 17.8B, nvidia · ~13 GB VRAMQwen3 30B A3B NVFP4 — 17.5B, RedHatAI · ~13 GB VRAMQwen3 32B NVFP4 — 17.2B, nvidia · ~15 GB VRAMParam2 17B A2.4B Thinking — 17.2B, bharatgenai · ~12 GB VRAMQwen3.6 27B NVFP4 — 17.1B, ocicek · ~20 GB VRAMHuihui Qwen3.6 27B abliterated NVFP4 MTP — 17.1B, sakamakismile · ~20 GB VRAMQwen3.6 27B AEON Ultimate Uncensored Multimodal NVFP4 MTP XS — 17.1B, AEON-7 · ~20 GB VRAMQwen3.6 27B Text NVFP4 MTP — 16.7B, sakamakismile · ~20 GB VRAMdeepseek moe 16b base — 16.4B, deepseek-ai · ~12 GB VRAMdeepseek moe 16b chat — 16.4B, deepseek-ai · ~12 GB VRAMLLaDA2.0 mini — 16.3B, inclusionAI · ~12 GB VRAMLLaDA2.1 mini — 16.3B, inclusionAI · ~12 GB VRAMLing mini 2.0 — 16.3B, inclusionAI · ~12 GB VRAMMoonlight 16B A3B Instruct — 16B, moonshotai · ~13 GB VRAMMoonlight 16B A3B — 16B, moonshotai · ~13 GB VRAMstarcoder — 15.8B, bigcode · ~19 GB VRAMDeepSeek-Coder-V2-Lite Instruct — 15.7B, DeepSeek · ~11 GB VRAMDeepSeek V2 Lite Chat — 15.7B, deepseek-ai · ~15 GB VRAMDeepSeek V2 Lite — 15.7B, deepseek-ai · ~15 GB VRAMQwen3 30B A3B NVFP4 — 15.6B, nvidia · ~12 GB VRAMQwen3 Coder 30B A3B Instruct FP4 — 15.6B, NVFP4 · ~12 GB VRAMGemma 4 26B A4B it NVFP4 — 15.1B, bg-digitalservices · ~18 GB VRAMGemma 4 26B A4B it Uncensored NVFP4 — 15.1B, AEON-7 · ~18 GB VRAMQwen2.5 Coder 14B Instruct — 14.8B, Qwen · ~14 GB VRAMQwen2.5 14B Instruct — 14.8B, Qwen · ~14 GB VRAMQwen3 14B — 14.8B, Qwen · ~13 GB VRAMDeepSeek R1 Distill Qwen 14B — 14.8B, deepseek-ai · ~14 GB VRAMQwen2.5 14B Instruct — 14.8B, unsloth · ~14 GB VRAMphi 4 quantized.w4a16 — 14.8B, RedHatAI · ~14 GB VRAMQwen2.5 14B — 14.8B, Qwen · ~14 GB VRAMQwen2.5 Coder 14B — 14.8B, Qwen · ~14 GB VRAMQwen3 14B Base — 14.8B, Qwen · ~13 GB VRAMQwen3 14B Instruct — 14.8B, OpenPipe · ~13 GB VRAMHyperCLOVAX SEED Think 14B — 14.7B, naver-hyperclovax · ~13 GB VRAMPhi 4 reasoning plus — 14.7B, microsoft · ~14 GB VRAMGemma 4 26B A4B NVFP4 — 14.4B, nvidia · ~17 GB VRAMdiffusiongemma 26B A4B it NVFP4 — 14.4B, nvidia · ~17 GB VRAMQwen1.5 MoE A2.7B — 14.3B, Qwen · ~12 GB VRAMPhi-4 — 14B, Microsoft · ~13 GB VRAMNemotron Labs Diffusion 14B — 13.5B, nvidia · ~13 GB VRAMtalkie 1930 13b it hf — 13.3B, lewtun · ~11 GB VRAMvllm translategemma 12b it — 13.2B, chbae624 · ~16 GB VRAMLlama 2 13b chat hf — 13B, meta-llama · ~16 GB VRAMHarmBench Llama 2 13b cls — 13B, cais · ~11 GB VRAMNVIDIA Nemotron Nano 12B v2 — 12.3B, nvidia · ~15 GB VRAMVikhr Nemo 12B Instruct R 21 09 24 — 12.2B, Vikhrmodels · ~12 GB VRAMmistralai Mistral Nemo Instruct 2407 — 12.2B, SillyTilly · ~12 GB VRAMMN 12B Mag Mell R1 — 12.2B, inflatebot · ~12 GB VRAMOur shortlist: Best LLMs for 24 GB VRAM →
Other GPU budgets 8 GB of VRAM · 16 GB of VRAM · 48 GB of VRAM · All models
Open the free LLM cost calculator → · Rate table dated 2026-08-24. $0 markup, your own accounts, we never resell compute. © 2026 Cynosure LLC.