Nemotron 3 Ultra 现已开放下载

NVIDIA Nemotron 模型中文下载站

官方收录 Nemotron 3 Ultra (55B 活跃参数)、Nemotron 3 Super、Nemotron 3 Nano 等顶级 MoE 大模型。 支持 Hugging Face、ModelScope、NVIDIA NIM、OpenRouter 多渠道下载,提供完整本地部署、API 调用、量化推理指南。

55B
活跃参数规模
1M
上下文长度
4
下载渠道
开源
OpenMDW-1.1 许可

Nemotron 3 系列模型

三款不同规模的混合 Mamba-Transformer MoE 模型,适配从边缘设备到数据中心的各类部署场景

Nemotron 3 Super

120B 总参数 / 12B 活跃参数,相同架构设计,平衡性能与资源占用。适合中型推理任务、企业级应用部署。

总参数 120B 活跃参数 12B 专家数 128 (每层激活 4) 量化 NVFP4 MTP 层 2 上下文 1M tokens
新发布

Nemotron 3 Nano

31.6B 总参数 / 3.2B 活跃参数,FP8 量化版本,极致轻量化。适合边缘设备、移动端、个人电脑本地运行,消费级显卡即可推理。

总参数 31.6B 活跃参数 3.2B 专家数 64 (每层激活 2) 量化 FP8 MTP 层 1 上下文 1M tokens
即将发布

Nemotron 4 Ultra

下一代 Nemotron 架构,预期参数规模更大、推理效率更高。敬请关注 NVIDIA 官方发布通知,本站将第一时间同步提供下载。

状态 预告中 架构 下一代 MoE 上下文 预期 ≥1M

多渠道下载方式

提供四大官方下载渠道,满足不同部署场景需求。推荐国内用户优先使用 ModelScope,海外用户使用 Hugging Face,企业级生产环境推荐 NVIDIA NIM。

Hugging Face

全球最大模型社区,完整的模型文件、Tokenizer、配置文件,支持 git-lfs 大文件下载,适合研究者和开发者。

访问模型库

ModelScope 魔搭社区

阿里达摩院社区镜像,国内下载速度极快,无需科学上网,提供模型文件、推理脚本、部署教程一站式服务。

访问模型库

NVIDIA NIM 微服务

生产级推理微服务,容器化部署,开箱即用 API,支持批量并行、KV 缓存优化、连续批处理,企业级 SLA 保障。

探索 NIM

OpenRouter API

统一 API 访问多模型,无需部署即可调用 Nemotron 系列,按量付费,适合快速原型开发和应用集成测试。

查看 API 定价

快速开始:本地部署指南

以 Nemotron 3 Ultra 为例,展示最常用的部署方式。更多详细教程请查看文档指南

方式一:llama.cpp (CPU/GPU 混合推理)

最流行的本地推理引擎,支持量化模型,消费级显卡即可运行。

bash
# 1. 克隆 llama.cpp
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp

# 2. 编译 (需 CMake, 支持 Metal/CUDA/ROCm)
make LLAMA_CUBLAS=1  # NVIDIA GPU
# make LLAMA_METAL=1  # Apple Silicon
# make                # 仅 CPU

# 3. 下载量化模型 (推荐 Q4_K_M 平衡质量与速度)
# Hugging Face: https://huggingface.co/nvidia/Nemotron-3-Ultra-GGUF
wget https://huggingface.co/nvidia/Nemotron-3-Ultra-GGUF/resolve/main/nemotron-3-ultra-Q4_K_M.gguf

# 4. 运行推理服务
./llama-server -m nemotron-3-ultra-Q4_K_M.gguf -c 32768 -ngl 99 --port 8080

# 5. 测试 API
curl http://localhost:8080/completion \
  -H "Content-Type: application/json" \
  -d '{"prompt": "Nemotron 3 Ultra 是什么?", "n_predict": 256}'

提示: Nemotron 3 Ultra 量化版约 35GB (Q4_K_M),建议 48GB+ 显存或统一内存。内存不足可尝试 Q3_K_L (约 28GB) 或使用 CPU 卸载层数 (-ngl 参数)。

方式二:vLLM (高吞吐生产部署)

高性能推理引擎,支持 PagedAttention、批量并行、流式输出,适合生产环境高并发服务。

bash
# 1. 安装 vLLM (需 CUDA 11.8+)
pip install vllm

# 2. 启动 OpenAI 兼容 API 服务
# Nemotron 3 Ultra 需 8x H100 80GB 或 8x A100 80GB
# 单卡可用 tensor_parallel_size=1 但需模型并行
python -m vllm.entrypoints.openai.api_server \
  --model nvidia/Nemotron-3-Ultra \
  --tensor-parallel-size 8 \
  --max-model-len 32768 \
  --dtype bfloat16 \
  --port 8000

# 3. 测试 (OpenAI 兼容格式)
curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "nvidia/Nemotron-3-Ultra",
    "messages": [{"role": "user", "content": "Nemotron 3 Ultra 的架构特点"}],
    "max_tokens": 512,
    "temperature": 0.7
  }'

硬件要求: Nemotron 3 Ultra FP16/BF16 约 1.1TB 显存,需 8-16 张 H100/A100 80GB。生产建议直接使用 NVIDIA NIM 或量化版本 (NVFP4/AWQ/GPTQ) 大幅降低显存占用。

方式三:NVIDIA NIM (企业级一键部署)

NVIDIA 官方优化的推理微服务,容器化交付,内置 TensorRT-LLM 优化,生产级稳定性。

bash
# 1. 获取 NGC API Key (需 NVIDIA 开发者账号)
# https://build.nvidia.com/nvidia/nemotron-3-ultra

# 2. 一键启动 NIM 容器
docker run -d --name nemotron-3-ultra \
  --gpus all \
  -p 8000:8000 \
  -e NGC_API_KEY=$NGC_API_KEY \
  nvcr.io/nim/nvidia/nemotron-3-ultra:latest

# 3. 验证健康检查
curl http://localhost:8000/v1/health

# 4. 调用 API (OpenAI 兼容)
curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "nemotron-3-ultra",
    "messages": [{"role": "user", "content": "介绍 Nemotron 3 Ultra"}],
    "max_tokens": 1024
  }'

优势: 内置 TensorRT-LLM 优化、FP8/NVFP4 量化、KV 缓存复用、连续批处理、指标监控。企业级支持、安全扫描、版本管理。适合生产环境直接部署。

方式四:Ollama (最简单本地体验)

一条命令安装运行,自动管理模型下载、量化、推理,适合快速验证和开发调试。

bash
# 1. 安装 Ollama
# macOS: brew install ollama
# Linux: curl -fsSL https://ollama.com/install.sh | sh
# Windows: 下载安装包 https://ollama.com/download

# 2. 拉取 Nemotron 3 Ultra (自动下载量化版)
ollama pull nemotron3-ultra

# 3. 运行交互式聊天
ollama run nemotron3-ultra

# 4. API 调用 (默认端口 11434)
curl http://localhost:11434/api/generate \
  -H "Content-Type: application/json" \
  -d '{
    "model": "nemotron3-ultra",
    "prompt": "Nemotron 3 Ultra 有什么特点?",
    "stream": false
  }'

# 列出本地模型
ollama list

注意: Ollama 社区维护的 Nemotron 模型可能非官方发布版本。生产环境建议使用官方 Hugging Face / NVIDIA NIM 渠道。Ollama 适合快速验证和原型开发。

核心基准测试表现

Nemotron 3 Ultra 在多项权威基准测试中表现优异,超越同规模开源模型。完整数据请查看模型对比页

基准测试 Nemotron 3 Ultra Nemotron 3 Super Nemotron 3 Nano Llama 3.1 405B Qwen 2.5 72B
语言理解与推理
MMLU (5-shot) 87.2% 82.1% 71.5% 88.6% 84.2%
MMLU-Pro 74.8% 68.3% 55.2% 76.1% 69.8%
GPQA-Diamond 58.4% 51.2% 38.7% 59.1% 49.3%
代码生成
HumanEval+ 89.0% 83.5% 72.1% 88.4% 85.7%
MBPP+ 85.3% 79.8% 68.4% 84.9% 81.2%
LiveCodeBench 48.7% 42.1% 31.5% 47.2% 43.8%
数学推理
MATH Level 5 62.1% 54.8% 41.3% 63.5% 58.9%
GSM8K (8-shot) 94.8% 91.2% 84.7% 95.1% 92.4%
中文能力
C-Eval 85.6% 79.3% 68.9% 84.2% 86.1%
CMMLU 83.4% 77.1% 66.2% 82.8% 84.5%

数据来源:NVIDIA 官方技术报告、Hugging Face Open LLM Leaderboard、第三方评测。实际表现受量化等级、推理配置、提示词工程影响。

开始使用 Nemotron 3 Ultra

立即下载体验 NVIDIA 最强开源 MoE 模型,加入开发者社区共同探索大模型边界