NVIDIA Nemotron 3 Ultra

nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16

参数量

550B

上下文

1024K

下载量

497K

点赞

316

架构

moe_transformer

在 HuggingFace 查看

GPU 需求

按量化方案和使用场景估算的显存 / 内存 / 磁盘

量化最低配置推荐配置生产配置
FP1616bit
1300.9 GB
RAM 1951.3 · Disk 1637.2
1375.5 GB
RAM 2063.3 · Disk 1663.2
1531.4 GB
RAM 2297.0 · Disk 1702.2
FP88bit
652.9 GB
RAM 979.4 · Disk 838.1
698.1 GB
RAM 1047.2 · Disk 864.1
824.5 GB
RAM 1236.7 · Disk 903.1
INT88bit
652.9 GB
RAM 979.4 · Disk 838.1
698.1 GB
RAM 1047.2 · Disk 864.1
824.5 GB
RAM 1236.7 · Disk 903.1
AWQ4bit
341.1 GB
RAM 511.6 · Disk 453.5
372.1 GB
RAM 558.2 · Disk 479.5
484.3 GB
RAM 726.4 · Disk 518.5
GPTQ4bit
345.1 GB
RAM 517.7 · Disk 458.5
376.4 GB
RAM 564.5 · Disk 484.5
488.7 GB
RAM 733.1 · Disk 523.5
GGUF4bit
353.2 GB
RAM 529.9 · Disk 468.5
384.8 GB
RAM 577.2 · Disk 494.5
497.5 GB
RAM 746.3 · Disk 533.5

GPU 推荐

Best ValueBEST

8× H200 SXM

1128 GB VRAM

$20,440/月

≈ 57.8 tok/s

可用生产吞吐 ≈ 40.5 tok/s

score 0.3077

Cheapest

8× RTX A6000

384 GB VRAM

$1,678/月

≈ 9.2 tok/s

可用生产吞吐 ≈ 6.4 tok/s

score 0.4893

Deploy on vast ↗
Performance

4× H200 SXM

564 GB VRAM

$10,220/月

≈ 43.4 tok/s

可用生产吞吐 ≈ 30.4 tok/s

score 0.4453

Min Complexity

4× H200 SXM

564 GB VRAM

$10,220/月

≈ 43.4 tok/s

可用生产吞吐 ≈ 30.4 tok/s

score 0.4453

💬 社区 —— 真实部署经验

0 文章 · 0 实测

进入社区 →
AmciHub

AI 模型部署与算力决策平台——分析 AI 模型的硬件需求、GPU 性能、云端价格与部署成本,帮助你选择合适的部署方案。

© 2026 AmciHub. 保留所有权利。 Model → Requirement → GPU → Benchmark → Cloud → Cost → Recommendation