GLM-4.5 Air
zai-org/GLM-4.5-Air
GLM-4.5 Air, efficient edge-optimized variant of the GLM-4.5 family.
Parameters
106B
Context
128K
Downloads
210K
Likes
1.1K
Architecture
moe_transformer
GPU Requirements
VRAM / RAM / disk estimates by quantization and usage scenario
| Quantization | Minimum | Recommended | Production |
|---|---|---|---|
| FP1616bit | 254.7 GB RAM 382.1 · Disk 347.0 | 281.8 GB RAM 422.7 · Disk 373.0 | 390.1 GB RAM 585.1 · Disk 412.0 |
| FP88bit | 129.8 GB RAM 194.8 · Disk 193.0 | 151.3 GB RAM 226.9 · Disk 219.0 | 253.8 GB RAM 380.8 · Disk 258.0 |
| INT88bit | 129.8 GB RAM 194.8 · Disk 193.0 | 151.3 GB RAM 226.9 · Disk 219.0 | 253.8 GB RAM 380.8 · Disk 258.0 |
| AWQ4bit | 69.7 GB RAM 104.6 · Disk 118.9 | 88.4 GB RAM 132.6 · Disk 144.9 | 188.3 GB RAM 282.4 · Disk 183.9 |
| GPTQ4bit | 70.5 GB RAM 105.8 · Disk 119.9 | 89.2 GB RAM 133.9 · Disk 145.9 | 189.1 GB RAM 283.7 · Disk 184.9 |
| GGUF4bit | 72.1 GB RAM 108.1 · Disk 121.8 | 90.9 GB RAM 136.3 · Disk 147.8 | 190.8 GB RAM 286.2 · Disk 186.8 |
GPU Recommendations
4× H200 SXM
564 GB VRAM
≈ 225 tok/s
Effective production throughput ≈ 157.5 tok/s
score 0.3112
8× Tesla V100
128 GB VRAM
≈ 0 tok/s (N/A — benchmark unavailable)
Effective production throughput ≈ 0 tok/s
score 0.5408
8× H200 SXM
1128 GB VRAM
≈ 299.9 tok/s
Effective production throughput ≈ 209.9 tok/s
score 0.2197
1× H200 SXM
141 GB VRAM
≈ 93.7 tok/s
Effective production throughput ≈ 65.6 tok/s
score 0.6383
💬 Community — real deployment experience
0 Articles · 0 Benchmarks
GPUs that fit (single card)
H200 SXM
141 GB VRAM
$2,555
/mo · lambda
B200
180 GB VRAM
$3,013
/mo · vast
B200 SXM
180 GB VRAM
—