Llama 4 Scout
meta-llama/Llama-4-Scout-17B-16E-Instruct
Parameters
109B
Context
10240K
Downloads
460.4K
Likes
1.3K
Architecture
moe_transformer
GPU Requirements
VRAM / RAM / disk estimates by quantization and usage scenario
| Quantization | Minimum | Recommended | Production |
|---|---|---|---|
| FP1616bit | 261.8 GB RAM 392.7 · Disk 355.7 | 289.2 GB RAM 433.8 · Disk 381.7 | 397.8 GB RAM 596.7 · Disk 420.7 |
| FP88bit | 133.4 GB RAM 200.1 · Disk 197.4 | 155.0 GB RAM 232.4 · Disk 223.4 | 257.7 GB RAM 386.5 · Disk 262.4 |
| INT88bit | 133.4 GB RAM 200.1 · Disk 197.4 | 155.0 GB RAM 232.4 · Disk 223.4 | 257.7 GB RAM 386.5 · Disk 262.4 |
| AWQ4bit | 71.6 GB RAM 107.4 · Disk 121.2 | 90.3 GB RAM 135.5 · Disk 147.2 | 190.3 GB RAM 285.4 · Disk 186.2 |
| GPTQ4bit | 72.4 GB RAM 108.6 · Disk 122.1 | 91.2 GB RAM 136.8 · Disk 148.1 | 191.2 GB RAM 286.7 · Disk 187.1 |
| GGUF4bit | 74.0 GB RAM 111.0 · Disk 124.1 | 92.9 GB RAM 139.3 · Disk 150.1 | 192.9 GB RAM 289.4 · Disk 189.1 |
GPU Recommendations
Best ValueBEST
4× H200 SXM
564 GB VRAM
$10,220/mo
≈ 218.8 tok/s
Effective production throughput ≈ 153.2 tok/s
score 0.3121
Cheapest
8× Tesla V100
128 GB VRAM
$169/mo
≈ 0 tok/s (N/A — benchmark unavailable)
Effective production throughput ≈ 0 tok/s
score 0.5447
Performance
8× H200 SXM
1128 GB VRAM
$20,440/mo
≈ 291.7 tok/s
Effective production throughput ≈ 204.2 tok/s
score 0.2197
Min Complexity
1× H200 SXM
141 GB VRAM
$2,555/mo
≈ 91.2 tok/s
Effective production throughput ≈ 63.8 tok/s
score 0.6419
💬 Community — real deployment experience
0 Articles · 0 Benchmarks
GPUs that fit (single card)
H200 SXM
141 GB VRAM
$2,555
/mo · lambda
B200
180 GB VRAM
$3,013
/mo · vast
B200 SXM
180 GB VRAM
—