Qwen/Qwen3-32B
Qwen/Qwen3-32B
Flagship open-weights Qwen3, best balance of quality and deployability. INT4 fits 24GB.
Parameters
20.9B
Context
40K
Downloads
8M
Likes
732
Architecture
qwen3
64 layers · 8 KV heads · head 128 · hidden 5120
GPU Requirements
VRAM / RAM / disk estimates by quantization and usage scenario
| Quantization | Minimum | Recommended | Production |
|---|---|---|---|
| FP1616bit | 82.2 GB RAM 123.4 · Disk 134.3 | 101.5 GB RAM 152.3 · Disk 160.3 | 201.9 GB RAM 302.9 · Disk 199.3 |
| FP88bit | 43.6 GB RAM 65.4 · Disk 86.7 | 61.1 GB RAM 91.7 · Disk 112.7 | 159.8 GB RAM 239.6 · Disk 151.7 |
| INT88bit | 43.6 GB RAM 65.4 · Disk 86.7 | 61.1 GB RAM 91.7 · Disk 112.7 | 159.8 GB RAM 239.6 · Disk 151.7 |
| AWQ4bit | 25.0 GB RAM 37.5 · Disk 63.7 | 41.7 GB RAM 62.5 · Disk 89.7 | 139.5 GB RAM 209.2 · Disk 128.7 |
| GPTQ4bit | 25.2 GB RAM 37.9 · Disk 64.0 | 41.9 GB RAM 62.9 · Disk 90.0 | 139.7 GB RAM 209.6 · Disk 129.0 |
| GGUF4bit | 25.7 GB RAM 38.6 · Disk 64.6 | 42.4 GB RAM 63.6 · Disk 90.6 | 140.3 GB RAM 210.4 · Disk 129.6 |
GPU Recommendations
1× H100 SXM
80 GB VRAM
≈ 211.4 tok/s
Effective production throughput ≈ 148 tok/s
score 0.6284
4× Tesla V100
64 GB VRAM
≈ 0 tok/s (N/A — benchmark unavailable)
Effective production throughput ≈ 0 tok/s
score 0.5719
8× H200 SXM
1128 GB VRAM
≈ 969.1 tok/s
Effective production throughput ≈ 678.4 tok/s
score 0.2197
1× RTX A6000
48 GB VRAM
≈ 48.5 tok/s
Effective production throughput ≈ 33.9 tok/s
score 0.6597
💬 Community — real deployment experience
0 Articles · 0 Benchmarks
GPUs that fit (single card)
RTX A6000
48 GB VRAM
$210
/mo · vast
L40S
48 GB VRAM
$341
/mo · vast
RTX PRO 6000 WS
48 GB VRAM
$482
/mo · vast
RTX PRO 6000 S
48 GB VRAM
$633
/mo · vast
A100 80GB
80 GB VRAM
$876
/mo · vast