Llama 3.3 70B
meta-llama/Llama-3.3-70B-Instruct
Parameters
70.6B
Context
128K
Downloads
334.5K
Likes
2.9K
Architecture
transformer
GPU Requirements
VRAM / RAM / disk estimates by quantization and usage scenario
| Quantization | Minimum | Recommended | Production |
|---|---|---|---|
| FP1616bit | 171.3 GB RAM 257.0 · Disk 244.1 | 194.6 GB RAM 291.9 · Disk 270.1 | 299.1 GB RAM 448.6 · Disk 309.1 |
| FP88bit | 88.1 GB RAM 132.2 · Disk 141.6 | 107.7 GB RAM 161.5 · Disk 167.6 | 208.3 GB RAM 312.5 · Disk 206.6 |
| INT88bit | 88.1 GB RAM 132.2 · Disk 141.6 | 107.7 GB RAM 161.5 · Disk 167.6 | 208.3 GB RAM 312.5 · Disk 206.6 |
| AWQ4bit | 48.1 GB RAM 72.2 · Disk 92.2 | 65.8 GB RAM 98.7 · Disk 118.2 | 164.7 GB RAM 247.0 · Disk 157.2 |
| GPTQ4bit | 48.6 GB RAM 72.9 · Disk 92.9 | 66.4 GB RAM 99.5 · Disk 118.9 | 165.2 GB RAM 247.9 · Disk 157.9 |
| GGUF4bit | 49.7 GB RAM 74.5 · Disk 94.1 | 67.4 GB RAM 101.2 · Disk 120.1 | 166.4 GB RAM 249.6 · Disk 159.1 |
GPU Recommendations
1× H200 SXM
141 GB VRAM
≈ 140.7 tok/s
Effective production throughput ≈ 98.5 tok/s
score 0.5955
8× Tesla V100
128 GB VRAM
≈ 0 tok/s (N/A — benchmark unavailable)
Effective production throughput ≈ 0 tok/s
score 0.4936
8× H200 SXM
1128 GB VRAM
≈ 450.3 tok/s
Effective production throughput ≈ 315.2 tok/s
score 0.2197
1× A100 80GB
80 GB VRAM
≈ 59.8 tok/s
Effective production throughput ≈ 41.9 tok/s
score 0.6669
💬 Community — real deployment experience
0 Articles · 0 Benchmarks
GPUs that fit (single card)
A100 80GB
80 GB VRAM
$876
/mo · vast
H100 SXM
80 GB VRAM
$1,170
/mo · vast
H200 SXM
141 GB VRAM
$2,555
/mo · lambda
B200
180 GB VRAM
$3,013
/mo · vast
B200 SXM
180 GB VRAM
—