Llama 2 13B
meta-llama/Llama-2-13b-chat-hf
Parameters
13B
Context
4K
Downloads
170.6K
Likes
1.1K
Architecture
transformer
GPU Requirements
VRAM / RAM / disk estimates by quantization and usage scenario
| Quantization | Minimum | Recommended | Production |
|---|---|---|---|
| FP1616bit | 35.6 GB RAM 53.4 · Disk 76.8 | 52.7 GB RAM 79.1 · Disk 102.8 | 151.0 GB RAM 226.5 · Disk 141.8 |
| FP88bit | 20.3 GB RAM 32.0 · Disk 57.9 | 36.7 GB RAM 55.1 · Disk 83.9 | 134.3 GB RAM 201.5 · Disk 122.9 |
| INT88bit | 20.3 GB RAM 32.0 · Disk 57.9 | 36.7 GB RAM 55.1 · Disk 83.9 | 134.3 GB RAM 201.5 · Disk 122.9 |
| AWQ4bit | 12.9 GB RAM 32.0 · Disk 48.8 | 29.0 GB RAM 43.5 · Disk 74.8 | 126.3 GB RAM 189.4 · Disk 113.8 |
| GPTQ4bit | 13.0 GB RAM 32.0 · Disk 48.9 | 29.1 GB RAM 43.7 · Disk 74.9 | 126.4 GB RAM 189.6 · Disk 113.9 |
| GGUF4bit | 13.2 GB RAM 32.0 · Disk 49.2 | 29.3 GB RAM 44.0 · Disk 75.2 | 126.6 GB RAM 189.9 · Disk 114.2 |
GPU Recommendations
1× H100 SXM
80 GB VRAM
≈ 533.4 tok/s
Effective production throughput ≈ 373.4 tok/s
score 0.5862
2× Tesla V100
32 GB VRAM
≈ 0 tok/s (N/A — benchmark unavailable)
Effective production throughput ≈ 0 tok/s
score 0.6049
8× H200 SXM
1128 GB VRAM
≈ 2445.9 tok/s
Effective production throughput ≈ 1712.1 tok/s
score 0.2197
1× RTX A6000
48 GB VRAM
≈ 122.3 tok/s
Effective production throughput ≈ 85.6 tok/s
score 0.6523
💬 Community — real deployment experience
0 Articles · 0 Benchmarks
GPUs that fit (single card)
RTX A6000
48 GB VRAM
$210
/mo · vast
RTX 5090
32 GB VRAM
$246
/mo · vast
L40S
48 GB VRAM
$341
/mo · vast
RTX PRO 6000 S
48 GB VRAM
$633
/mo · vast
RTX PRO 6000 WS
48 GB VRAM
$634
/mo · vast