Cross-encoder
cross-encoder/ms-marco-MiniLM-L4-v2
cross-encoder/ms-marco-MiniLM-L4-v2
参数量
18.8M
上下文
512
下载量
8.8M
点赞
28
架构
bert
4 layers · head 32 · hidden 384
GPU 需求
按量化方案和使用场景估算的显存 / 内存 / 磁盘
| 量化 | 最低配置 | 推荐配置 | 生产配置 |
|---|---|---|---|
| FP1616bit | 2.3 GB RAM 32.0 · Disk 39.1 | 2.7 GB RAM 32.0 · Disk 65.1 | 5.3 GB RAM 32.0 · Disk 104.1 |
| FP88bit | 2.3 GB RAM 32.0 · Disk 39.0 | 2.7 GB RAM 32.0 · Disk 65.0 | 5.3 GB RAM 32.0 · Disk 104.0 |
| INT88bit | 2.3 GB RAM 32.0 · Disk 39.0 | 2.7 GB RAM 32.0 · Disk 65.0 | 5.3 GB RAM 32.0 · Disk 104.0 |
| AWQ4bit | 2.3 GB RAM 32.0 · Disk 39.0 | 2.7 GB RAM 32.0 · Disk 65.0 | 5.3 GB RAM 32.0 · Disk 104.0 |
| GPTQ4bit | 2.3 GB RAM 32.0 · Disk 39.0 | 2.7 GB RAM 32.0 · Disk 65.0 | 5.3 GB RAM 32.0 · Disk 104.0 |
| GGUF4bit | 2.3 GB RAM 32.0 · Disk 39.0 | 2.7 GB RAM 32.0 · Disk 65.0 | 5.3 GB RAM 32.0 · Disk 104.0 |
GPU 推荐
Best ValueBEST
1× RTX 5080
16 GB VRAM
$78.7/月
≈ 96000 tok/s
可用生产吞吐 ≈ 67200 tok/s
score 0.5404
Cheapest
1× Tesla V100
16 GB VRAM
$19.9/月
≈ 0 tok/s (N/A — benchmark unavailable)
可用生产吞吐 ≈ 0 tok/s
score 0.5348
Performance
8× H200 SXM
1128 GB VRAM
$20,440/月
≈ 1536000 tok/s
可用生产吞吐 ≈ 1075200 tok/s
score 0.2197
Min Complexity
1× RTX 5060 Ti
8 GB VRAM
$40.4/月
≈ 44800 tok/s
可用生产吞吐 ≈ 31360 tok/s
score 0.5827
💬 社区 —— 真实部署经验
0 文章 · 0 实测
单卡可运行的 GPU
Tesla V100
16 GB VRAM
$19.9
/月 · vast
RTX 5060 Ti
8 GB VRAM
$40.4
/月 · vast
RTX 3090
24 GB VRAM
$49.5
/月 · vast
RTX 4070S Ti
16 GB VRAM
$49.5
/月 · vast
RTX 5070
12 GB VRAM
$58.7
/月 · vast