推理框架支持对比
| 推理框架 | Ultra | Super | Nano |
|---|---|---|---|
| NVIDIA NIM | ✅ 最佳 | ✅ 最佳 | ✅ 最佳 |
| vLLM | ✅ TP=8 | ✅ TP=2-4 | ⚠️ 过重 |
| llama.cpp | ✅ 量化版 | ✅ 推荐 | ✅ 最佳 |
| Ollama | ⚠️ 社区版 | ✅ 支持 | ✅ 最佳 |
| TensorRT-LLM | ✅ 生产级 | ✅ 生产级 | ⚠️ 支持有限 |
| MLC LLM | ⚠️ 实验性 | ✅ 支持 | ✅ 移动端最佳 |
NVIDIA Nemotron 3 Ultra / Super / Nano 全面对比
| 推理框架 | Ultra | Super | Nano |
|---|---|---|---|
| NVIDIA NIM | ✅ 最佳 | ✅ 最佳 | ✅ 最佳 |
| vLLM | ✅ TP=8 | ✅ TP=2-4 | ⚠️ 过重 |
| llama.cpp | ✅ 量化版 | ✅ 推荐 | ✅ 最佳 |
| Ollama | ⚠️ 社区版 | ✅ 支持 | ✅ 最佳 |
| TensorRT-LLM | ✅ 生产级 | ✅ 生产级 | ⚠️ 支持有限 |
| MLC LLM | ⚠️ 实验性 | ✅ 支持 | ✅ 移动端最佳 |
| 配置 | 预填充 | 解码 |
|---|---|---|
| Ultra NVFP4 (2×H100) | ~2,500 | ~180 |
| Super NVFP4 (1×H100) | ~4,200 | ~320 |
| Nano FP8 (RTX 4090) | ~8,500 | ~650 |
| Ultra Q4_K_M (llama.cpp, 48GB) | ~800 | ~45 |
| Super Q4_K_M (llama.cpp, 12GB) | ~1,800 | ~120 |
| Nano Q4_K_M (llama.cpp, 8GB) | ~3,200 | ~280 |
* 仅供参考,实际吞吐受上下文长度、批大小、KV Cache 策略显著影响
所有模型均通过官方渠道分发,建议优先使用官方链接确保文件完整性与安全性