模型对比

NVIDIA Nemotron 3 Ultra / Super / Nano 全面对比

推理框架支持对比

推理框架 Ultra Super Nano
NVIDIA NIM ✅ 最佳 ✅ 最佳 ✅ 最佳
vLLM ✅ TP=8 ✅ TP=2-4 ⚠️ 过重
llama.cpp ✅ 量化版 ✅ 推荐 ✅ 最佳
Ollama ⚠️ 社区版 ✅ 支持 ✅ 最佳
TensorRT-LLM ✅ 生产级 ✅ 生产级 ⚠️ 支持有限
MLC LLM ⚠️ 实验性 ✅ 支持 ✅ 移动端最佳

📊 吞吐估算 (tokens/s)

配置 预填充 解码
Ultra NVFP4 (2×H100) ~2,500 ~180
Super NVFP4 (1×H100) ~4,200 ~320
Nano FP8 (RTX 4090) ~8,500 ~650
Ultra Q4_K_M (llama.cpp, 48GB) ~800 ~45
Super Q4_K_M (llama.cpp, 12GB) ~1,800 ~120
Nano Q4_K_M (llama.cpp, 8GB) ~3,200 ~280

* 仅供参考,实际吞吐受上下文长度、批大小、KV Cache 策略显著影响

立即开始使用 Nemotron 3

选择适合你的模型规模,通过官方渠道下载体验 NVIDIA 最强开源 MoE 模型