Nemotron 3 Ultra
550B 总参数 / 55B 活跃参数,Hybrid Mamba-Transformer MoE 架构,LatentMoE 路由,NVFP4 量化,4 层 MTP,1M 上下文。适合复杂推理、代码生成、多轮对话。
三款不同规模的混合 Mamba-Transformer MoE 模型,适配从边缘设备到数据中心的各类部署场景
550B 总参数 / 55B 活跃参数,Hybrid Mamba-Transformer MoE 架构,LatentMoE 路由,NVFP4 量化,4 层 MTP,1M 上下文。适合复杂推理、代码生成、多轮对话。
120B 总参数 / 12B 活跃参数,相同架构设计,平衡性能与资源占用。适合中型推理任务、企业级应用部署。
31.6B 总参数 / 3.2B 活跃参数,FP8 量化版本,极致轻量化。适合边缘设备、移动端、个人电脑本地运行,消费级显卡即可推理。
下一代 Nemotron 架构,预期参数规模更大、推理效率更高。敬请关注 NVIDIA 官方发布通知,本站将第一时间同步提供下载。
提供四大官方下载渠道,满足不同部署场景需求。推荐国内用户优先使用 ModelScope,海外用户使用 Hugging Face,企业级生产环境推荐 NVIDIA NIM。
以 Nemotron 3 Ultra 为例,展示最常用的部署方式。更多详细教程请查看文档指南。
最流行的本地推理引擎,支持量化模型,消费级显卡即可运行。
# 1. 克隆 llama.cpp
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
# 2. 编译 (需 CMake, 支持 Metal/CUDA/ROCm)
make LLAMA_CUBLAS=1 # NVIDIA GPU
# make LLAMA_METAL=1 # Apple Silicon
# make # 仅 CPU
# 3. 下载量化模型 (推荐 Q4_K_M 平衡质量与速度)
# Hugging Face: https://huggingface.co/nvidia/Nemotron-3-Ultra-GGUF
wget https://huggingface.co/nvidia/Nemotron-3-Ultra-GGUF/resolve/main/nemotron-3-ultra-Q4_K_M.gguf
# 4. 运行推理服务
./llama-server -m nemotron-3-ultra-Q4_K_M.gguf -c 32768 -ngl 99 --port 8080
# 5. 测试 API
curl http://localhost:8080/completion \
-H "Content-Type: application/json" \
-d '{"prompt": "Nemotron 3 Ultra 是什么?", "n_predict": 256}'
提示: Nemotron 3 Ultra 量化版约 35GB (Q4_K_M),建议 48GB+ 显存或统一内存。内存不足可尝试 Q3_K_L (约 28GB) 或使用 CPU 卸载层数 (-ngl 参数)。
高性能推理引擎,支持 PagedAttention、批量并行、流式输出,适合生产环境高并发服务。
# 1. 安装 vLLM (需 CUDA 11.8+)
pip install vllm
# 2. 启动 OpenAI 兼容 API 服务
# Nemotron 3 Ultra 需 8x H100 80GB 或 8x A100 80GB
# 单卡可用 tensor_parallel_size=1 但需模型并行
python -m vllm.entrypoints.openai.api_server \
--model nvidia/Nemotron-3-Ultra \
--tensor-parallel-size 8 \
--max-model-len 32768 \
--dtype bfloat16 \
--port 8000
# 3. 测试 (OpenAI 兼容格式)
curl http://localhost:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "nvidia/Nemotron-3-Ultra",
"messages": [{"role": "user", "content": "Nemotron 3 Ultra 的架构特点"}],
"max_tokens": 512,
"temperature": 0.7
}'
硬件要求: Nemotron 3 Ultra FP16/BF16 约 1.1TB 显存,需 8-16 张 H100/A100 80GB。生产建议直接使用 NVIDIA NIM 或量化版本 (NVFP4/AWQ/GPTQ) 大幅降低显存占用。
NVIDIA 官方优化的推理微服务,容器化交付,内置 TensorRT-LLM 优化,生产级稳定性。
# 1. 获取 NGC API Key (需 NVIDIA 开发者账号)
# https://build.nvidia.com/nvidia/nemotron-3-ultra
# 2. 一键启动 NIM 容器
docker run -d --name nemotron-3-ultra \
--gpus all \
-p 8000:8000 \
-e NGC_API_KEY=$NGC_API_KEY \
nvcr.io/nim/nvidia/nemotron-3-ultra:latest
# 3. 验证健康检查
curl http://localhost:8000/v1/health
# 4. 调用 API (OpenAI 兼容)
curl http://localhost:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "nemotron-3-ultra",
"messages": [{"role": "user", "content": "介绍 Nemotron 3 Ultra"}],
"max_tokens": 1024
}'
优势: 内置 TensorRT-LLM 优化、FP8/NVFP4 量化、KV 缓存复用、连续批处理、指标监控。企业级支持、安全扫描、版本管理。适合生产环境直接部署。
一条命令安装运行,自动管理模型下载、量化、推理,适合快速验证和开发调试。
# 1. 安装 Ollama
# macOS: brew install ollama
# Linux: curl -fsSL https://ollama.com/install.sh | sh
# Windows: 下载安装包 https://ollama.com/download
# 2. 拉取 Nemotron 3 Ultra (自动下载量化版)
ollama pull nemotron3-ultra
# 3. 运行交互式聊天
ollama run nemotron3-ultra
# 4. API 调用 (默认端口 11434)
curl http://localhost:11434/api/generate \
-H "Content-Type: application/json" \
-d '{
"model": "nemotron3-ultra",
"prompt": "Nemotron 3 Ultra 有什么特点?",
"stream": false
}'
# 列出本地模型
ollama list
注意: Ollama 社区维护的 Nemotron 模型可能非官方发布版本。生产环境建议使用官方 Hugging Face / NVIDIA NIM 渠道。Ollama 适合快速验证和原型开发。
Nemotron 3 Ultra 在多项权威基准测试中表现优异,超越同规模开源模型。完整数据请查看模型对比页。
数据来源:NVIDIA 官方技术报告、Hugging Face Open LLM Leaderboard、第三方评测。实际表现受量化等级、推理配置、提示词工程影响。