Llama 2 7B
meta-llama/Llama-2-7b-chat-hf
Parameters
6.7B
Context
4K
Downloads
721.9K
Likes
4.8K
Architecture
transformer
GPU Requirements
VRAM / RAM / disk estimates by quantization and usage scenario
| Quantization | Minimum | Recommended | Production |
|---|---|---|---|
| FP1616bit | 20.7 GB RAM 32.0 · Disk 58.5 | 37.2 GB RAM 55.8 · Disk 84.5 | 134.8 GB RAM 202.2 · Disk 123.5 |
| FP88bit | 12.8 GB RAM 32.0 · Disk 48.7 | 29.0 GB RAM 43.4 · Disk 74.7 | 126.2 GB RAM 189.3 · Disk 113.7 |
| INT88bit | 12.8 GB RAM 32.0 · Disk 48.7 | 29.0 GB RAM 43.4 · Disk 74.7 | 126.2 GB RAM 189.3 · Disk 113.7 |
| AWQ4bit | 9.0 GB RAM 32.0 · Disk 44.1 | 25.0 GB RAM 37.5 · Disk 70.1 | 122.1 GB RAM 183.1 · Disk 109.1 |
| GPTQ4bit | 9.1 GB RAM 32.0 · Disk 44.1 | 25.0 GB RAM 37.6 · Disk 70.1 | 122.1 GB RAM 183.2 · Disk 109.1 |
| GGUF4bit | 9.2 GB RAM 32.0 · Disk 44.2 | 25.1 GB RAM 37.7 · Disk 70.2 | 122.2 GB RAM 183.3 · Disk 109.2 |
GPU Recommendations
1× RTX 5090
32 GB VRAM
≈ 553.1 tok/s
Effective production throughput ≈ 387.2 tok/s
score 0.6885
2× Tesla V100
32 GB VRAM
≈ 0 tok/s (N/A — benchmark unavailable)
Effective production throughput ≈ 0 tok/s
score 0.6371
8× H200 SXM
1128 GB VRAM
≈ 4740.7 tok/s
Effective production throughput ≈ 3318.5 tok/s
score 0.2197
1× A100 PCIE
80 GB VRAM
≈ 0 tok/s (N/A — benchmark unavailable)
Effective production throughput ≈ 0 tok/s
score 0.5692
💬 Community — real deployment experience
0 Articles · 0 Benchmarks
GPUs that fit (single card)
A100 PCIE
80 GB VRAM
$196
/mo · vast
RTX A6000
48 GB VRAM
$210
/mo · vast
RTX 5090D
32 GB VRAM
$245
/mo · vast
RTX 5090
32 GB VRAM
$294
/mo · vast
L40S
48 GB VRAM
$341
/mo · vast