What can I run · updated Oct 11, 2026

Local LLMs that run on a 32 GB graphics card

42 of the 56 models we've tested fit, with room for a normal-length chat. The best one is Qwen3.6 27B, scoring 97 out of 100.

#ModelScoreCodingDocumentsDownloadMemory
1 Qwen3.6 27B 97 97 97 Q6 25.6 GB
2 Muse Glimmer 30B 94 90 98 Q6 25.6 GB
3 gpt-oss-20b
ollama run gpt-oss:20b
88 90 87 standard 12.1 GB
4 Qwen3.5-27B 88 77 100 Q6 25.6 GB
5 Qwen3.8 27B 88 77 99 Q6 25.6 GB
6 Qwen3.5-35B-A3B 88 80 95 Q6 30.9 GB
7 Qwen3.6 35B A3B 86 80 93 Q6 30.9 GB
8 Laguna XS 2.1 82 73 91 Q6 29.5 GB
9 Nemotron 3 Nano 30B A3B 80 70 91 Q6 27.1 GB
10 Gemma 4 31B 79 93 65 Q5 30.9 GB
11 Granite 4.2 8B 77 77 78 Q8 11.3 GB
12 Qwen3 30B A3B
ollama run qwen3:30b
77 67 87 Q6 26.6 GB
13 Qwen3 VL 30B A3B Thinking 77 60 93 Q6 27 GB
14 Qwen3 14B
ollama run qwen3:14b
72 63 81 Q8 17.6 GB
15 GLM 4.7 Flash 72 73 70 Q6 29.5 GB
16 Qwen3.5-9B 72 47 97 Q8 11.9 GB
17 Gemma 4 26B A4B 70 83 58 Q8 30 GB
18 Qwen3 32B
ollama run qwen3:32b
64 50 79 Q6 29.7 GB
19 Nemotron 3.5 Lightning 57 43 72 Q6 27.1 GB
20 Nex-N2.5-Mini 57 27 88 Q6 30.2 GB
21 Qwen3 Coder 30B A3B Instruct
ollama run qwen3-coder:30b
51 57 46 Q6 26.6 GB
22 Qwen3 VL 30B A3B Instruct 46 43 49 Q6 27 GB
23 Ministral 3 14B 2512 44 43 45 Q8 16.8 GB
24 Mistral Small 3.2 24B 44 40 47 Q8 27.5 GB
25 Mistral Small 3 41 37 45 Q8 27 GB
26 Gemma 3 27B
ollama run gemma3:27b
40 33 46 Q8 31.2 GB
27 Qwen3 30B A3B Instruct 2507 40 33 46 Q6 26.6 GB
28 Qwen3 VL 8B Instruct 39 37 41 Q8 11.1 GB
29 Ministral 3 8B 2512 37 30 43 Q8 11.2 GB
30 Gemma 3 12B
ollama run gemma3:12b
35 30 40 Q8 14.6 GB
31 Phi 4
ollama run phi4
25 23 26 Q8 17.9 GB
32 Qwen2.5 7B Instruct
ollama run qwen2.5:7b
24 10 37 Q8 9.2 GB
33 Gemma 2 27B
ollama run gemma2:27b
23 13 34 Q8 31 GB
34 Llama 3.3 8B Instruct (Q4, Mac)
ollama run hf.co/bartowski/allura-forge_Llama-3.3-8B-Instruct-GGUF:Q4_K_M
23 13 33 Q4 6 GB
35 Mistral Nemo
ollama run mistral-nemo
23 10 36 Q8 15 GB
36 Granite 4.0 Micro (Q4, Mac)
ollama run granite4:micro-h
22 13 31 Q4 3.2 GB
37 Ministral 3 3B 2512 21 10 32 Q8 5.6 GB
38 Llama 3.1 8B Instruct
ollama run llama3.1:8b
15 3 26 Q8 9.6 GB
39 Gemma 3 4B
ollama run gemma3:4b
14 3 25 Q8 5.7 GB
40 Reka Edge 8 0 16 Q8 9.2 GB
41 Llama 3.2 3B Instruct
ollama run llama3.2:3b
6 0 13 Q8 4.5 GB
42 Llama 3.2 1B Instruct (Q4, Mac)
ollama run llama3.2:1b-instruct-q4_K_M
5 0 9 Q4 1.9 GB

"Download" is the biggest version that fits on 32 GB graphics card; "Memory" is roughly what that version needs. Smaller versions also work and leave more room. Q4 or Q8?

Top models that don't fit

  • gpt-oss-120b (96/100) needs about 63.3 GB even in its smallest version.
  • Ling 3.0 Flash (94/100) needs about 83.5 GB even in its smallest version.
  • GLM 4.5V (93/100) needs about 67.4 GB even in its smallest version.
  • Ling 3.0 Flash VL (92/100) needs about 81.9 GB even in its smallest version.
  • GLM 4.5 Air (76/100) needs about 69.1 GB even in its smallest version.

Not sure how much memory you have? Here's how to check.