Qwen/Qwen2.5-7B-Instruct-AWQ
Qwen/Qwen2.5-7B-Instruct-AWQ
Parameters
4.9B
Context
32K
Downloads
4.6M
Likes
49
Architecture
qwen2
28 layers · 4 KV heads · head 128 · hidden 3584
GPU Requirements
VRAM / RAM / disk estimates by quantization and usage scenario
| Quantization | Minimum | Recommended | Production |
|---|---|---|---|
| FP1616bit | 15.6 GB RAM 32.0 · Disk 53.1 | 25.3 GB RAM 38.0 · Disk 79.1 | 77.9 GB RAM 116.8 · Disk 118.1 |
| FP88bit | 9.9 GB RAM 32.0 · Disk 46.1 | 19.4 GB RAM 32.0 · Disk 72.1 | 71.7 GB RAM 107.5 · Disk 111.1 |
| INT88bit | 9.9 GB RAM 32.0 · Disk 46.1 | 19.4 GB RAM 32.0 · Disk 72.1 | 71.7 GB RAM 107.5 · Disk 111.1 |
| AWQ4bit | 7.1 GB RAM 32.0 · Disk 42.7 | 16.5 GB RAM 32.0 · Disk 68.7 | 68.6 GB RAM 103.0 · Disk 107.7 |
| GPTQ4bit | 7.1 GB RAM 32.0 · Disk 42.7 | 16.5 GB RAM 32.0 · Disk 68.7 | 68.7 GB RAM 103.0 · Disk 107.7 |
| GGUF4bit | 7.2 GB RAM 32.0 · Disk 42.8 | 16.6 GB RAM 32.0 · Disk 68.8 | 68.8 GB RAM 103.1 · Disk 107.8 |
GPU Recommendations
1× RTX 5090
32 GB VRAM
≈ 762.6 tok/s
Effective production throughput ≈ 533.8 tok/s
score 0.6347
1× RTX 3090
24 GB VRAM
≈ 398.3 tok/s
Effective production throughput ≈ 278.8 tok/s
score 0.6781
8× H200 SXM
1128 GB VRAM
≈ 6536.2 tok/s
Effective production throughput ≈ 4575.3 tok/s
score 0.2197
1× RTX 4090
24 GB VRAM
≈ 428.9 tok/s
Effective production throughput ≈ 300.2 tok/s
score 0.6781
💬 Community — real deployment experience
0 Articles · 0 Benchmarks
GPUs that fit (single card)
RTX 3090
24 GB VRAM
$76.5
/mo · vast
RTX 4090
24 GB VRAM
$99.0
/mo · vast
RTX 4090D
24 GB VRAM
$117
/mo · vast
L4
24 GB VRAM
$147
/mo · vast
A10
24 GB VRAM
$176
/mo · vast