LLMOpenai
openai/gpt-oss-120b
openai/gpt-oss-120b
Parameters
4.2B
Context
128K
Downloads
4.3M
Likes
5.1K
Architecture
gpt_oss
36 layers · 8 KV heads · head 64 · hidden 2880
GPU Requirements
VRAM / RAM / disk estimates by quantization and usage scenario
| Quantization | Minimum | Recommended | Production |
|---|---|---|---|
| FP1616bit | 280.6 GB RAM 421.0 · Disk 379.0 | 308.9 GB RAM 463.4 · Disk 405.0 | 418.3 GB RAM 627.5 · Disk 444.0 |
| FP88bit | 142.8 GB RAM 214.2 · Disk 209.0 | 164.8 GB RAM 247.2 · Disk 235.0 | 268.0 GB RAM 402.0 · Disk 274.0 |
| INT88bit | 142.8 GB RAM 214.2 · Disk 209.0 | 164.8 GB RAM 247.2 · Disk 235.0 | 268.0 GB RAM 402.0 · Disk 274.0 |
| AWQ4bit | 76.5 GB RAM 114.7 · Disk 127.2 | 95.5 GB RAM 143.2 · Disk 153.2 | 195.6 GB RAM 293.4 · Disk 192.2 |
| GPTQ4bit | 77.3 GB RAM 116.0 · Disk 128.2 | 96.4 GB RAM 144.5 · Disk 154.2 | 196.5 GB RAM 294.8 · Disk 193.2 |
| GGUF4bit | 79.0 GB RAM 118.6 · Disk 130.4 | 98.2 GB RAM 147.2 · Disk 156.4 | 198.4 GB RAM 297.6 · Disk 195.4 |
GPU Recommendations
Best ValueBEST
4× H200 SXM
564 GB VRAM
$10,220/mo
≈ 203.8 tok/s
Effective production throughput ≈ 142.7 tok/s
score 0.3145
Cheapest
4× RTX 3090
96 GB VRAM
$306/mo
≈ 39.7 tok/s
Effective production throughput ≈ 27.8 tok/s
score 0.5563
Performance
8× H200 SXM
1128 GB VRAM
$20,440/mo
≈ 271.7 tok/s
Effective production throughput ≈ 190.2 tok/s
score 0.2197
Min Complexity
1× H200 SXM
141 GB VRAM
$2,555/mo
≈ 84.9 tok/s
Effective production throughput ≈ 59.4 tok/s
score 0.6516
💬 Community — real deployment experience
0 Articles · 0 Benchmarks
GPUs that fit (single card)
H200 SXM
141 GB VRAM
$2,555
/mo · lambda
B200
180 GB VRAM
$3,013
/mo · vast
B200 SXM
180 GB VRAM
—