LLMQwen
Qwen/Qwen2.5-3B-Instruct
Qwen/Qwen2.5-3B-Instruct
参数量
2.1B
上下文
32K
下载量
6.7M
点赞
550
架构
qwen2
36 layers · 2 KV heads · head 128 · hidden 2048
GPU 需求
按量化方案和使用场景估算的显存 / 内存 / 磁盘
| 量化 | 最低配置 | 推荐配置 | 生产配置 |
|---|---|---|---|
| FP1616bit | 12.3 GB RAM 32.0 · Disk 48.0 | 28.3 GB RAM 42.5 · Disk 74.0 | 125.6 GB RAM 188.4 · Disk 113.0 |
| FP88bit | 8.6 GB RAM 32.0 · Disk 43.5 | 24.5 GB RAM 36.8 · Disk 69.5 | 121.6 GB RAM 182.4 · Disk 108.5 |
| INT88bit | 8.6 GB RAM 32.0 · Disk 43.5 | 24.5 GB RAM 36.8 · Disk 69.5 | 121.6 GB RAM 182.4 · Disk 108.5 |
| AWQ4bit | 6.8 GB RAM 32.0 · Disk 41.3 | 22.7 GB RAM 34.0 · Disk 67.3 | 119.7 GB RAM 179.5 · Disk 106.3 |
| GPTQ4bit | 6.9 GB RAM 32.0 · Disk 41.4 | 22.7 GB RAM 34.1 · Disk 67.4 | 119.7 GB RAM 179.5 · Disk 106.4 |
| GGUF4bit | 6.9 GB RAM 32.0 · Disk 41.4 | 22.8 GB RAM 34.1 · Disk 67.4 | 119.7 GB RAM 179.6 · Disk 106.4 |
GPU 推荐
Best ValueBEST
1× RTX 5090
32 GB VRAM
$244/月
≈ 1194.7 tok/s
可用生产吞吐 ≈ 836.3 tok/s
score 0.6867
Cheapest
2× Tesla V100
32 GB VRAM
$19.9/月
≈ 0 tok/s (N/A — benchmark unavailable)
可用生产吞吐 ≈ 0 tok/s
score 0.6361
Performance
8× H200 SXM
1128 GB VRAM
$20,440/月
≈ 10240 tok/s
可用生产吞吐 ≈ 7168 tok/s
score 0.2197
Min Complexity
1× RTX 3090
24 GB VRAM
$78.7/月
≈ 624 tok/s
可用生产吞吐 ≈ 436.8 tok/s
score 0.643
💬 社区 —— 真实部署经验
0 文章 · 0 实测
单卡可运行的 GPU
RTX 3090
24 GB VRAM
$78.7
/月 · vast
RTX 4090
24 GB VRAM
$98.1
/月 · vast
RTX 4090D
24 GB VRAM
$117
/月 · vast
L4
24 GB VRAM
$148
/月 · vast
A10
24 GB VRAM
$176
/月 · vast