Qwen2.5 72B
Qwen/Qwen2.5-72B-Instruct
Parameters
72.7B
Context
128K
Downloads
415.1K
Likes
971
Architecture
transformer
GPU Requirements
VRAM / RAM / disk estimates by quantization and usage scenario
| Quantization | Minimum | Recommended | Production |
|---|---|---|---|
| FP1616bit | 176.3 GB RAM 264.4 · Disk 250.3 | 199.8 GB RAM 299.7 · Disk 276.3 | 304.5 GB RAM 456.7 · Disk 315.3 |
| FP88bit | 90.6 GB RAM 135.9 · Disk 144.6 | 110.2 GB RAM 165.4 · Disk 170.6 | 211.0 GB RAM 316.6 · Disk 209.6 |
| INT88bit | 90.6 GB RAM 135.9 · Disk 144.6 | 110.2 GB RAM 165.4 · Disk 170.6 | 211.0 GB RAM 316.6 · Disk 209.6 |
| AWQ4bit | 49.4 GB RAM 74.1 · Disk 93.8 | 67.2 GB RAM 100.7 · Disk 119.8 | 166.1 GB RAM 249.1 · Disk 158.8 |
| GPTQ4bit | 49.9 GB RAM 74.9 · Disk 94.5 | 67.7 GB RAM 101.6 · Disk 120.5 | 166.7 GB RAM 250.0 · Disk 159.5 |
| GGUF4bit | 51.0 GB RAM 76.5 · Disk 95.8 | 68.8 GB RAM 103.2 · Disk 121.8 | 167.8 GB RAM 251.7 · Disk 160.8 |
GPU Recommendations
1× H200 SXM
141 GB VRAM
≈ 136.7 tok/s
Effective production throughput ≈ 95.7 tok/s
score 0.5981
8× Tesla V100
128 GB VRAM
≈ 0 tok/s (N/A — benchmark unavailable)
Effective production throughput ≈ 0 tok/s
score 0.4964
8× H200 SXM
1128 GB VRAM
≈ 437.4 tok/s
Effective production throughput ≈ 306.2 tok/s
score 0.2197
1× A100 80GB
80 GB VRAM
≈ 58.1 tok/s
Effective production throughput ≈ 40.7 tok/s
score 0.6625
💬 Community — real deployment experience
0 Articles · 0 Benchmarks
GPUs that fit (single card)
A100 80GB
80 GB VRAM
$876
/mo · vast
H100 SXM
80 GB VRAM
$1,170
/mo · vast
H200 SXM
141 GB VRAM
$2,555
/mo · lambda
B200
180 GB VRAM
$3,013
/mo · vast
B200 SXM
180 GB VRAM
—