Model guide

Qwen3 32B

Qwen3 · 32B dense · up to 128K context.

Local inference profile

Architecture
Dense
Parameters read per token
32B
Maximum context
131,072 tokens
FP16 KV cache per 1K tokens
0.262 GB

Published quantisations

FormatEffective B/paramEstimated weights
BF16/FP162.0064.0 GB
Q8_01.0834.6 GB
Q6_K0.8426.9 GB
Q5_K_M0.7022.4 GB
Q4_K_M0.5718.2 GB
Q3_K_M0.4614.7 GB
Q2_K0.3410.9 GB