picksbycard
August 23, 2026No. 113
Will it run?

Which models fit which card.

50 open-weight models against the 17 cards in our catalog. Weights are sized from the parameter count (all experts count for MoE), a 1.5 GiB reserve covers the runtime and a small KV cache, and what is left is your context headroom. Tap any cell for the full verdict at Q4, Q8 and FP16.

The grid

Q4_K_M verdicts
fits comfortablytightCPU offloadno
Model · weights at Q4RTX 509032GBRTX 3090 (used)24GBRTX 4090 (used)24GBRX 7900 XTX24GBRTX 5060 Ti 16GB16GBRTX 5070 Ti16GBRTX 508016GBRX 7800 XT16GBRX 9060 XT 16GB16GBRX 907016GBRX 9070 XT16GBArc B58012GBRTX 3060 12GB (used)12GBRTX 4070 Super12GBRTX 507012GBArc B57010GBRTX 50608GB
Qwen3 0.6B0.6B · 0.3 GiB YesYesYesYesYesYesYesYesYesYesYesYesYesYesYesYesYes
Gemma 3 1B IT1B · 0.6 GiB YesYesYesYesYesYesYesYesYesYesYesYesYesYesYesYesYes
Llama 3.2 1B Instruct1.23B · 0.7 GiB YesYesYesYesYesYesYesYesYesYesYesYesYesYesYesYesYes
Qwen3 1.7B1.7B · 0.9 GiB YesYesYesYesYesYesYesYesYesYesYesYesYesYesYesYesYes
Llama 3.2 3B Instruct3.21B · 1.8 GiB YesYesYesYesYesYesYesYesYesYesYesYesYesYesYesYesYes
Phi-3.5 mini Instruct3.82B · 2.1 GiB YesYesYesYesYesYesYesYesYesYesYesYesYesYesYesYesYes
Phi-4 mini Instruct3.84B · 2.1 GiB YesYesYesYesYesYesYesYesYesYesYesYesYesYesYesYesYes
Qwen3 4B4B · 2.2 GiB YesYesYesYesYesYesYesYesYesYesYesYesYesYesYesYesYes
Gemma 3 4B IT4.3B · 2.4 GiB YesYesYesYesYesYesYesYesYesYesYesYesYesYesYesYesYes
Qwen3.5 4B4.66B · 2.6 GiB YesYesYesYesYesYesYesYesYesYesYesYesYesYesYesYesYes
Mistral 7B Instruct v0.37.25B · 4.1 GiB YesYesYesYesYesYesYesYesYesYesYesYesYesYesYesYesYes
Qwen2.5 7B Instruct7.61B · 4.3 GiB YesYesYesYesYesYesYesYesYesYesYesYesYesYesYesYesYes
Qwen2.5 Coder 7B Instruct7.61B · 4.3 GiB YesYesYesYesYesYesYesYesYesYesYesYesYesYesYesYesYes
DeepSeek R1 Distill Qwen 7B7.62B · 4.3 GiB YesYesYesYesYesYesYesYesYesYesYesYesYesYesYesYesYes
DeepSeek R1 Distill Llama 8B8.03B · 4.5 GiB YesYesYesYesYesYesYesYesYesYesYesYesYesYesYesYesYes
Hermes 3 Llama 3.1 8B8.03B · 4.5 GiB YesYesYesYesYesYesYesYesYesYesYesYesYesYesYesYesYes
Llama 3.1 8B Instruct8.03B · 4.5 GiB YesYesYesYesYesYesYesYesYesYesYesYesYesYesYesYesYes
Qwen3 8B8.2B · 4.6 GiB YesYesYesYesYesYesYesYesYesYesYesYesYesYesYesYesYes
Qwen2.5-VL 7B Instruct8.29B · 4.6 GiB YesYesYesYesYesYesYesYesYesYesYesYesYesYesYesYesYes
Gemma 2 9B IT9.24B · 5.2 GiB YesYesYesYesYesYesYesYesYesYesYesYesYesYesYesYesYes
Qwen3.5 9B9.65B · 5.4 GiB YesYesYesYesYesYesYesYesYesYesYesYesYesYesYesYesTight
Gemma 3 12B IT12.2B · 6.8 GiB YesYesYesYesYesYesYesYesYesYesYesYesYesYesYesYesOffload
Mistral NeMo 12B Instruct (2407)12.2B · 6.8 GiB YesYesYesYesYesYesYesYesYesYesYesYesYesYesYesYesOffload
Phi-4 (14B)14.7B · 8.2 GiB YesYesYesYesYesYesYesYesYesYesYesYesYesYesYesTightOffload
DeepSeek R1 Distill Qwen 14B14.8B · 8.3 GiB YesYesYesYesYesYesYesYesYesYesYesYesYesYesYesTightOffload
Qwen3 14B14.8B · 8.3 GiB YesYesYesYesYesYesYesYesYesYesYesYesYesYesYesTightOffload
gpt-oss-20b21B MoE (3.6B active) · 11.7 GiB YesYesYesYesYesYesYesYesYesYesYesOffloadOffloadOffloadOffloadOffloadOffload
Codestral 22B v0.122.2B · 12.4 GiB YesYesYesYesTightTightTightTightTightTightTightOffloadOffloadOffloadOffloadOffloadOffload
Mistral Small 3.2 24B Instruct (2506)24B · 13.4 GiB YesYesYesYesTightTightTightTightTightTightTightOffloadOffloadOffloadOffloadOffloadOffload
Gemma 4 26B-A4B IT25.8B MoE (3.8B active) · 14.4 GiB YesYesYesYesTightTightTightTightTightTightTightOffloadOffloadOffloadOffloadOffloadOffload
Gemma 3 27B IT27.4B · 15.3 GiB YesYesYesYesOffloadOffloadOffloadOffloadOffloadOffloadOffloadOffloadOffloadOffloadOffloadOffloadNo
Qwen3.6 27B27.8B · 15.5 GiB YesYesYesYesOffloadOffloadOffloadOffloadOffloadOffloadOffloadOffloadOffloadOffloadOffloadOffloadNo
GLM-4.7-Flash30B MoE (3B active) · 16.8 GiB YesYesYesYesOffloadOffloadOffloadOffloadOffloadOffloadOffloadOffloadOffloadOffloadOffloadOffloadNo
Qwen3 30B-A3B30.5B MoE (3.3B active) · 17.0 GiB YesYesYesYesOffloadOffloadOffloadOffloadOffloadOffloadOffloadOffloadOffloadOffloadOffloadOffloadNo
Gemma 4 31B IT31.3B · 17.5 GiB YesYesYesYesOffloadOffloadOffloadOffloadOffloadOffloadOffloadOffloadOffloadOffloadOffloadOffloadNo
Qwen2.5 Coder 32B Instruct32.5B · 18.2 GiB YesYesYesYesOffloadOffloadOffloadOffloadOffloadOffloadOffloadOffloadOffloadOffloadOffloadOffloadNo
DeepSeek R1 Distill Qwen 32B32.8B · 18.3 GiB YesYesYesYesOffloadOffloadOffloadOffloadOffloadOffloadOffloadOffloadOffloadOffloadOffloadOffloadNo
Qwen3 32B32.8B · 18.3 GiB YesYesYesYesOffloadOffloadOffloadOffloadOffloadOffloadOffloadOffloadOffloadOffloadOffloadOffloadNo
Qwen3.6 35B-A3B36B MoE (3B active) · 20.1 GiB YesTightTightTightOffloadOffloadOffloadOffloadOffloadOffloadOffloadOffloadOffloadOffloadOffloadNoNo
Mixtral 8x7B Instruct v0.146.7B MoE (12.9B active) · 26.1 GiB TightOffloadOffloadOffloadOffloadOffloadOffloadOffloadOffloadOffloadOffloadNoNoNoNoNoNo
Llama 3.3 70B Instruct70.6B · 39.5 GiB OffloadOffloadOffloadOffloadNoNoNoNoNoNoNoNoNoNoNoNoNo
GLM-4.5-Air106B MoE (12B active) · 59.2 GiB OffloadNoNoNoNoNoNoNoNoNoNoNoNoNoNoNoNo
Llama 4 Scout (17B x 16E) Instruct109B MoE (17B active) · 60.9 GiB OffloadNoNoNoNoNoNoNoNoNoNoNoNoNoNoNoNo
gpt-oss-120b117B MoE (5.1B active) · 65.4 GiB NoNoNoNoNoNoNoNoNoNoNoNoNoNoNoNoNo
Mixtral 8x22B Instruct v0.1141B MoE (39B active) · 78.8 GiB NoNoNoNoNoNoNoNoNoNoNoNoNoNoNoNoNo
Qwen3 235B-A22B235B MoE (22B active) · 131.3 GiB NoNoNoNoNoNoNoNoNoNoNoNoNoNoNoNoNo
DeepSeek V4 Flash284B MoE (13B active) · 158.7 GiB NoNoNoNoNoNoNoNoNoNoNoNoNoNoNoNoNo
Llama 4 Maverick (17B x 128E) Instruct400B MoE (17B active) · 223.5 GiB NoNoNoNoNoNoNoNoNoNoNoNoNoNoNoNoNo
DeepSeek R1 (671B)671B MoE (37B active) · 375.0 GiB NoNoNoNoNoNoNoNoNoNoNoNoNoNoNoNoNo
Kimi K2 Instruct1000B MoE (32B active) · 558.8 GiB NoNoNoNoNoNoNoNoNoNoNoNoNoNoNoNoNo

Method: weights in GiB = parameters x bytes per parameter (Q4_K_M 0.60, Q8_0 1.06, FP16 2.0), plus a fixed 1.5 GiB reserve. "Fits comfortably" means that total sits within 85% of the card's memory; "tight" means it fits with little room for context; "CPU offload" means the weights exceed VRAM by up to 2x and can still run slowly with layers offloaded to system RAM. Parameter counts come from each model's card or release notes; the per-token KV cache depends on the architecture and is not in this table, so treat the headroom figures as a budget, not a promise.

The Silicon Note

One short read on the GPU market, most mornings. No spam, one-click out.