文档指南
Nemotron 3 系列模型完整文档 — 从快速上手到生产部署,涵盖安装、量化、微调、API 集成等全方位指南
快速开始指南
Nemotron 3 系列包含三个规模的模型,适用于不同的硬件条件和应用场景。本指南将帮助您在 5 分钟内运行起第一个 Nemotron 模型。
选择合适的模型
根据您的硬件条件选择最适合的模型:
- Nemotron 3 Ultra (550B/55B) — 旗舰级性能,需要多 GPU 服务器 (H100×8 或 A100×8+),适合企业级生产环境
- Nemotron 3 Super (120B/12B) — 高性价比,单张 H100/A100 80GB 可运行量化版本,适合中型部署
- Nemotron 3 Nano (31.6B/3.2B) — 轻量级,消费级 GPU (RTX 3090/4090 24GB) 即可运行,适合本地开发和边缘部署
5 分钟快速上手 (以 llama.cpp 为例)
-
安装 llama.cpp
git clone https://github.com/ggerganov/llama.cpp cd llama.cpp make -j$(nproc) -
下载模型 (以 Nano GGUF 为例)
# 从 Hugging Face 下载量化版本 wget https://huggingface.co/nvidia/Nemotron-3-Nano-GGUF/resolve/main/Nemotron-3-Nano-Q4_K_M.gguf # 或从 ModelScope 下载 (国内更快) wget https://modelscope.cn/models/nvidia/Nemotron-3-Nano-GGUF/resolve/master/Nemotron-3-Nano-Q4_K_M.gguf -
运行推理
# 交互式聊天模式 ./llama-cli -m Nemotron-3-Nano-Q4_K_M.gguf -c 32768 -p "用户: 你好\n助手:" -cnv # 服务器模式 (OpenAI 兼容 API) ./llama-server -m Nemotron-3-Nano-Q4_K_M.gguf -c 32768 --port 8080 -
测试 API
curl http://localhost:8080/v1/chat/completions \ -H "Content-Type: application/json" \ -d '{ "model": "Nemotron-3-Nano", "messages": [{"role": "user", "content": "用 Python 写一个快速排序"}], "temperature": 0.7, "max_tokens": 2048 }'
首次运行建议使用 -c 32768 设置上下文长度,Nemotron 3 系列支持高达 1M tokens 上下文,但需要更多内存。GGUF 量化版本在消费级显卡上推荐使用 Q4_K_M 或 Q5_K_M 平衡质量和速度。
模型选择指南
Nemotron 3 系列采用统一的 Hybrid Mamba-Transformer MoE 架构,三个规模模型共享相同的架构设计,仅在专家数量、隐藏层维度和训练数据规模上有所不同。
核心规格对比
| 规格 | Nemotron 3 Ultra | Nemotron 3 Super | Nemotron 3 Nano |
|---|---|---|---|
| 总参数量 | 550B | 120B | 31.6B |
| 激活参数 | 55B | 12B | 3.2B |
| 专家数量 | 256 | 128 | 64 |
| 每 Token 激活专家 | 4 | 4 | 4 |
| 隐藏层维度 | 6144 | 4096 | 2560 |
| 层数 | 80 (含 4 MTP) | 60 (含 4 MTP) | 40 (含 4 MTP) |
| 注意力头数 | 48 | 32 | 20 |
| Mamba 状态维度 | 256 | 192 | 128 |
| 上下文长度 | 1M tokens (所有模型统一) | ||
| 量化格式 | NVFP4, FP8, GGUF | FP8, GGUF | FP8, GGUF |
| 许可证 | OpenMDW-1.1 | NVIDIA Nemotron Open Model License | |
硬件需求估算
| 模型 | 量化格式 | 显存需求 (单卡) | 推荐部署 | 预估吞吐 (tokens/s) |
| Ultra | NVFP4 (4-bit) | ~280 GB (需 4×H100 80GB) | NVIDIA NIM / TensorRT-LLM | ~15,000 (8×H100) |
| FP8 | ~550 GB (需 8×H100 80GB) | NVIDIA NIM / Megatron-LM | ~8,000 (8×H100) | |
| BF16 | ~1.1 TB (需 16×H100 80GB) | 大规模集群训练/推理 | ~4,000 (16×H100) | |
| Super | FP8 | ~65 GB (H100 80GB / A100 80GB) | vLLM / TensorRT-LLM | ~3,500 (H100) |
| INT4 (GGUF) | ~35 GB (RTX 4090 24GB + 系统内存) | llama.cpp / Ollama | ~45 (RTX 4090) | |
| BF16 | ~240 GB (4×A100 80GB) | 多卡推理 | ~1,800 (4×A100) | |
| Nano | FP8 | ~18 GB (RTX 3090/4090 24GB) | vLLM / TensorRT-LLM | ~1,200 (RTX 4090) |
| INT4 (GGUF Q4_K_M) | ~8 GB (RTX 3060 12GB+) | llama.cpp / Ollama / 本地部署 | ~85 (RTX 4090) | |
| BF16 | ~64 GB (A100 80GB / 2×RTX 4090) | 单卡/双卡全精度 | ~600 (A100) |
上述显存估算包含模型权重 + KV Cache (基于 4096 上下文) + 激活值缓冲。实际使用中,上下文越长显存占用越大。GGUF 量化版本可通过 CPU 卸载 (--split-mode layer) 在显存不足时运行,但速度会显著下降。
系统要求
最低硬件要求
| 组件 | Nano (GGUF INT4) | Super (GGUF INT4) | Ultra (NVFP4/FP8) |
| GPU 显存 | ≥ 8 GB (推荐 12 GB+) | ≥ 24 GB (推荐 48 GB+) | ≥ 80 GB × 4 (H100/A100) |
| 系统内存 | ≥ 16 GB | ≥ 64 GB | ≥ 512 GB |
| 存储空间 | ≥ 15 GB (模型 + 缓存) | ≥ 60 GB | ≥ 600 GB (NVMe 推荐) |
| CPU | 现代 x86_64 / ARM64 (4 核+) | 现代 x86_64 (8 核+) | Intel Xeon / AMD EPYC (32 核+) |
| 操作系统 | Linux (Ubuntu 20.04+/22.04+), Windows 10/11 (WSL2 推荐), macOS 12+ (Apple Silicon) | ||
| 驱动/运行时 | NVIDIA Driver 535+, CUDA 12.1+, cuDNN 8.9+ | ||
软件依赖
llama.cpp / GGUF 部署指南
llama.cpp 是在消费级硬件上运行 Nemotron 3 模型的最佳选择,支持 GGUF 量化格式,可在 CPU、Apple Metal、CUDA、Vulkan 等后端运行。
安装
从 GitHub Releases 下载对应平台的预编译版本,解压即用。
从源码编译 (推荐,性能最优)
# Ubuntu/Debian
sudo apt update && sudo apt install -y build-essential cmake curl libcurl4-openssl-dev
# GPU 支持 (CUDA)
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
mkdir build && cd build
cmake .. -DGGML_CUDA=ON -DCMAKE_BUILD_TYPE=Release
cmake --build . --config Release -j$(nproc)
# Apple Silicon (Metal)
cmake .. -DGGML_METAL=ON -DCMAKE_BUILD_TYPE=Release
# 仅 CPU (AVX2 优化)
cmake .. -DCMAKE_BUILD_TYPE=Release
模型下载
| 模型 | Hugging Face 仓库 | 推荐量化 | 文件大小 |
| Nano | nvidia/Nemotron-3-Nano-GGUF | Q4_K_M, Q5_K_M, Q8_0 | 8-16 GB |
| Super | nvidia/Nemotron-3-Super-GGUF | Q4_K_M, Q5_K_M | 35-45 GB |
| Ultra | nvidia/Nemotron-3-Ultra-GGUF | Q4_K_M (需多卡) | ~140 GB |
运行参数详解
| 参数 | 说明 | 推荐值 |
-m, --model |
模型文件路径 | 必填 |
-c, --ctx-size |
上下文窗口大小 | 32768 (最长 1048576) |
-ngl, --gpu-layers |
卸载到 GPU 的层数 | -1 (全量) / 根据显存调整 |
-b, --batch-size |
批处理大小 | 512 (服务器) / 256 (本地) |
-ub, --ubatch-size |
微批次大小 | 512 |
-fa, --flash-attn |
启用 Flash Attention | 开启 (CUDA 11.7+) |
--mlock |
锁定内存防止交换 | 生产环境推荐开启 |
--no-mmap |
禁用 mmap (加快加载) | 内存充足时可开启 |
-t, --threads |
CPU 线程数 | 物理核心数 |
-cb, --cont-batching |
持续批处理 (服务器模式) | 服务器模式必开 |
常用运行模式
1. 交互式聊天
./llama-cli -m Nemotron-3-Nano-Q4_K_M.gguf \
-c 32768 -ngl 99 -fa \
-p "用户: 你好\n助手:" \
-cnv --color
2. OpenAI 兼容 API 服务器
./llama-server -m Nemotron-3-Nano-Q4_K_M.gguf \
-c 32768 -ngl 99 -fa \
--port 8080 --host 0.0.0.0 \
--parallel 4 --cont-batching \
--mlock --no-mmap
3. 基准测试
# 测试吞吐量
./llama-bench -m Nemotron-3-Nano-Q4_K_M.gguf -ngl 99 -fa -b 512 -ub 512
# 测试延迟
./llama-cli -m Nemotron-3-Nano-Q4_K_M.gguf -ngl 99 -fa -p "测试" -n 128 --timing
vLLM / TensorRT-LLM 部署指南
vLLM 和 TensorRT-LLM 是生产环境高吞吐推理的首选方案,支持 FP8/BF16 精度,适合 Super 和 Nano 模型的服务化部署。
vLLM 快速部署
安装
# 使用 Docker (推荐)
docker run --runtime nvidia --gpus all \
-v ~/.cache/huggingface:/root/.cache/huggingface \
-p 8000:8000 \
--ipc=host \
vllm/vllm-openai:latest \
--model nvidia/Nemotron-3-Nano-FP8 \
--dtype float8 \
--max-model-len 32768 \
--gpu-memory-utilization 0.9 \
--tensor-parallel-size 1
原生安装
pip install vllm
# 启动服务
python -m vllm.entrypoints.openai.api_server \
--model nvidia/Nemotron-3-Nano-FP8 \
--dtype float8 \
--max-model-len 32768 \
--gpu-memory-utilization 0.9 \
--tensor-parallel-size 1 \
--port 8000
TensorRT-LLM 部署
TensorRT-LLM 提供极致的推理性能,适合对延迟敏感的生产环境。
# 克隆并构建
git clone https://github.com/NVIDIA/TensorRT-LLM
cd TensorRT-LLM
pip install -r requirements.txt
# 转换模型 (以 Nemotron-3-Nano 为例)
python examples/llama/convert_checkpoint.py \
--model_dir nvidia/Nemotron-3-Nano-FP8 \
--output_dir /tmp/nanotron_trt \
--dtype float8 \
--tp_size 1
# 构建引擎
trtllm-build --checkpoint_dir /tmp/nanotron_trt \
--output_dir /tmp/nanotron_engine \
--gemm_plugin float8 \
--max_batch_size 8 \
--max_input_len 4096 \
--max_output_len 2048
# 启动 Triton 推理服务器
tritonserver --model-repository /tmp/nanotron_engine
多 GPU 张量并行
| 模型 | 最小 GPU 数 (FP8) | 推荐 GPU 数 | 张量并行配置 |
| Nano | 1 (24GB) | 1 | tp=1 |
| Super | 1 (80GB) / 2 (40GB) | 2-4 | tp=2/4 |
| Ultra | 4 (80GB) | 8 | tp=8 (pipeline parallel) |
vLLM 的 --max-model-len 需与硬件显存匹配:Nano FP8 在 24GB 显存可设 32768,Super FP8 在 80GB 显存可设 65536,Ultra 因模型巨大通常使用 NVIDIA NIM 或 TensorRT-LLM 的多卡方案。设置过长会 OOM,建议先用 --max-model-len 8192 验证再逐步调大。
NVIDIA NIM 微服务部署
NVIDIA NIM (NVIDIA Inference Microservices) 提供生产就绪的推理微服务,支持一键部署到本地数据中心或云端,内置优化推理引擎、负载均衡与可观测性监控。
本地容器部署
# 使用 NIM 容器部署 Nemotron 3 Super
docker run --runtime nvidia --gpus all -it --rm \
-p 8000:8000 \
nvcr.io/nim/nvidia/nemotron-3-super:latest \
--model nvidia/Nemotron-3-Super-FP8
无需本地 GPU,可直接在 NVIDIA Build 上体验 Nemotron 3 系列模型的 API,提供免费额度,开箱即用。
调用 API
curl -X POST "https://integrate.api.nvidia.com/v1/chat/completions" \
-H "Authorization: Bearer $NVIDIA_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "nvidia/nemotron-3-super",
"messages": [{"role": "user", "content": "解释一下混合专家模型"}],
"temperature": 0.7,
"max_tokens": 1024
}'
Ollama 本地部署
Ollama 是本地运行大模型最简单的方式,自动管理模型下载与量化,内置 OpenAI 兼容 API 服务器,适合快速体验与本地开发。
安装并运行
# macOS / Linux 一键安装
curl -fsSL https://ollama.com/install.sh | sh
# 运行 Nemotron 3 Nano (自动下载量化版本)
ollama run nemotron3:nano
# 运行 Super (需足够显存)
ollama run nemotron3:super
Ollama 官方库中的 Nemotron 3 模型命名以实际发布为准,可通过 ollama search nemotron 查看可用标签与量化版本。
Docker 容器化部署
使用 Docker 部署可保证环境一致性,便于在 Kubernetes 等编排系统中水平扩展。以下以 vLLM 镜像为例。
docker-compose 示例
services:
nemotron:
image: vllm/vllm-openai:latest
runtime: nvidia
ports:
- "8000:8000"
environment:
- NVIDIA_VISIBLE_DEVICES=all
command: >
--model nvidia/Nemotron-3-Nano-FP8
--dtype float8
--max-model-len 32768
--gpu-memory-utilization 0.9
--tensor-parallel-size 1
deploy:
resources:
reservations:
devices:
- driver: nvidia
count: 1
capabilities: [gpu]
量化部署指南
量化是降低显存占用、提升推理吞吐的关键手段。Nemotron 3 系列支持 NVFP4、FP8、INT4 (GGUF) 等多种量化格式。
量化格式对比
| 格式 | 压缩比 | 质量损失 | 适用引擎 | 推荐场景 |
| BF16 | 1× | 无 | 所有 | 研究 / 最高质量 |
| FP8 | 2× | 极低 | vLLM / TensorRT-LLM / NIM | 生产推理 |
| NVFP4 | 4× | 低 | TensorRT-LLM / NIM | Ultra 多卡 |
| GGUF Q4_K_M | ~4-8× | 低-中 | llama.cpp / Ollama | 消费级显卡 |
| GGUF Q8_0 | ~2× | 极低 | llama.cpp / Ollama | 本地高质量 |
GGUF 量化 (llama.cpp)
# 将 Hugging Face 权重转换为 GGUF 并量化
python convert_hf_to_gguf.py nvidia/Nemotron-3-Nano-FP8 --outfile nano-f16.gguf
./llama-quantize nano-f16.gguf Nemotron-3-Nano-Q4_K_M.gguf Q4_K_M
Nano 推荐 Q4_K_M 起步,质量与速度均衡;Super 显存不足用 Q4_K_M,充足用 Q6_K;Ultra 走 NVFP4/FP8 多卡方案,不建议 GGUF。
微调与训练
Nemotron 3 系列支持监督微调 (SFT) 与偏好对齐 (RLHF/DPO)。Super 与 Nano 采用 NVIDIA Open Model License,允许商业用途下的微调;Ultra 采用 OpenMDW-1.1,微调需遵守其使用条款。
基于 NeMo 的 LoRA 微调
# 使用 NVIDIA NeMo 进行 LoRA 微调
python /opt/NeMo/examples/nlp/language_modeling/tuning/peft_lora_tuning.py \
model.pretrained_model_name=nvidia/Nemotron-3-Nano-FP8 \
model.peft.lora_tuning.adapter_dim=16 \
trainer.devices=1 trainer.accelerator=gpu \
exp_manager.exp_dir=./nemotron3-nano-lora
Ultra 模型的微调产物在分发前需确认 OpenMDW-1.1 条款;Super/Nano 依据 NVIDIA Open Model License,月活超 1 亿需申请授权。
长上下文处理
Nemotron 3 原生支持最长 1M token 的上下文窗口,采用 Mamba 状态空间层处理长序列,对超长文档检索、代码库理解与多轮对话格外友好。
| 模型 | 原生上下文 | RoPE 外推 |
| Nano | 1M | 无需外推 |
| Super | 1M | 无需外推 |
| Ultra | 1M | 无需外推 |
处理超长上下文时,推理显存随序列长度增长。建议配合 vLLM 的 PagedAttention 或 TensorRT-LLM 的 KV Cache 量化,降低长序列开销。
性能调优
以下参数可显著改善吞吐与首 token 延迟 (TTFT):
- --gpu-memory-utilization:设为 0.9~0.95 以最大化 KV Cache 容量。
- --max-num-seqs:提高并发序列数,提升吞吐但增加显存压力。
- --enable-prefix-caching:对共享系统提示复用 KV Cache,多轮对话收益明显。
- --speculative-decoding:配合 MTP 头使用草稿模型,降低解码延迟。
Nemotron 3 内置多 token 预测 (MTP) 头,可在支持投机解码的引擎中启用,显著提升生成速度而不损失质量。
OpenAI 兼容 API 参考
vLLM、TensorRT-LLM、NIM、Ollama 均提供 OpenAI 兼容接口,可直接复用现有 OpenAI SDK,仅需切换 base_url 与 model。
聊天补全请求
POST /v1/chat/completions
{
"model": "nvidia/Nemotron-3-Nano-FP8",
"messages": [
{"role": "system", "content": "你是一个有帮助的中文助手。"},
{"role": "user", "content": "用一句话解释 MoE。"}
],
"temperature": 0.6,
"top_p": 0.9,
"max_tokens": 512,
"stream": true
}
常用参数
| 参数 | 说明 | 建议值 |
| temperature | 采样随机性 | 0.5~0.8 |
| top_p | 核采样 | 0.9 |
| max_tokens | 最大生成长度 | 512~4096 |
| stream | 流式输出 | true |
Python SDK 使用
通过 OpenAI Python SDK 连接本地或云端 Nemotron 3 服务,仅需设置 base_url 指向推理端点。
from openai import OpenAI
client = OpenAI(
base_url="http://localhost:8000/v1", # 本地 vLLM / NIM
api_key="not-needed",
)
resp = client.chat.completions.create(
model="nvidia/Nemotron-3-Nano-FP8",
messages=[{"role": "user", "content": "你好,介绍一下你自己。"}],
stream=True,
)
for chunk in resp:
if chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="")
LangChain 集成
使用 LangChain 的 ChatOpenAI 包装 Nemotron 3,即可复用 RAG、Agent、记忆等生态能力。
from langchain_openai import ChatOpenAI
from langchain_core.messages import HumanMessage
llm = ChatOpenAI(
model="nvidia/Nemotron-3-Super-FP8",
base_url="http://localhost:8000/v1",
api_key="not-needed",
temperature=0.6,
)
print(llm.invoke([HumanMessage(content="用三句话总结 MoE 的优势。")]).content)
LlamaIndex 集成
LlamaIndex 可基于 Nemotron 3 构建检索增强生成 (RAG) 应用,适合知识库问答与文档分析。
from llama_index.llms.openai import OpenAI
from llama_index.core import Settings, VectorStoreIndex, SimpleDirectoryReader
Settings.llm = OpenAI(
model="nvidia/Nemotron-3-Nano-FP8",
api_base="http://localhost:8000/v1",
api_key="not-needed",
)
docs = SimpleDirectoryReader("./data").load_data()
index = VectorStoreIndex.from_documents(docs)
query_engine = index.as_query_engine()
print(query_engine.query("根据文档,Nemotron 3 的架构特点是什么?"))
基准测试参考
以下为公开评测口径的近似结果(以官方发布为准),展示 Nemotron 3 系列在主流中英文基准上的表现。
| 基准 | Nano (31.6B) | Super (120B) | Ultra (550B) |
| MMLU (英文) | ~78 | ~85 | ~90 |
| CMMLU (中文) | ~76 | ~84 | ~88 |
| GSM8K (数学) | ~80 | ~88 | ~93 |
| HumanEval (代码) | ~72 | ~82 | ~89 |
上述数值为示意性区间,不代表 NVIDIA 官方精确成绩;实际评测请参考各模型 HF 卡片与官方技术报告。
模型架构
Nemotron 3 采用混合 Mamba-Transformer 架构,结合 LatentMoE 稀疏专家与前馈层压缩,并引入多 token 预测 (MTP) 头用于投机解码。
- 混合结构:Transformer 注意力层负责全局依赖,Mamba 状态空间层高效建模长序列,兼顾质量与效率。
- LatentMoE:将专家权重以低秩潜在表示压缩,降低显存与计算开销,使超大参数量可在有限硬件上运行。
- 多 token 预测 (MTP):一次预测多个 token,配合投机解码显著提升生成吞吐。
- 1M 上下文:原生支持百万级 token,适合超长文档与代码库场景。
Ultra 总参数 550B、激活 55B、256 专家;Super 总参数 120B、激活 12B、128 专家;Nano 总参数 31.6B、激活 3.2B、64 专家。激活参数远小于总参数,是 MoE 高效推理的关键。
开源许可证
三款模型采用不同许可证,使用前请仔细阅读对应条款:
| 模型 | 许可证 | 商用微调 | 月活限制 |
| Ultra | OpenMDW-1.1 | 需遵守条款 | 以条款为准 |
| Super | NVIDIA Open Model License | 允许 | 超 1 亿需授权 |
| Nano | NVIDIA Open Model License | 允许 | 超 1 亿需授权 |
月活跃用户超过 1 亿的产品或服务,使用 Super/Nano 需向 NVIDIA 申请授权;Ultra 的分发与衍生需符合 OpenMDW-1.1。详见 关于页许可证说明。
常见问题
Q1:消费级显卡能跑哪个模型?
A:Nano Q4_K_M 可在 24GB 显存(如 RTX 4090)流畅运行;Super 需 80GB 级显存(如 A100/H100);Ultra 需多卡 NVFP4 方案。
Q2:中文支持怎么样?
A:三款模型均支持中英双语,CMMLU 等中文基准表现接近英文,适合中文场景。
Q3:为什么 llama.cpp 找不到模型?
A:需先转换为 GGUF 格式并量化,或使用 Ollama 自动拉取;Ollama 库内搜索 nemotron 查看可用标签。
Q4:显存不够怎么办?
A:优先量化(FP8/Q4_K_M)、启用 KV Cache 量化、降低 --max-model-len,或使用 NVIDIA NIM 云端推理。
更新日志
| 版本 | 日期 | 说明 |
| v1.4.0 | 2025-06 | 补充 LangChain / LlamaIndex 集成与基准测试章节 |
| v1.3.0 | 2025-04 | 新增 NVIDIA NIM 与 Docker 部署指南 |
| v1.2.0 | 2025-03 | 新增量化格式对比与性能调优建议 |
| v1.1.0 | 2025-02 | 补充 Super / Nano 部署与 API 参考 |
| v1.0.0 | 2025-01 | 文档站首个版本,含快速开始与 Ultra 部署 |