文档指南

Nemotron 3 系列模型完整文档 — 从快速上手到生产部署,涵盖安装、量化、微调、API 集成等全方位指南

快速开始指南

Nemotron 3 系列包含三个规模的模型,适用于不同的硬件条件和应用场景。本指南将帮助您在 5 分钟内运行起第一个 Nemotron 模型。

选择合适的模型

模型快速选择

根据您的硬件条件选择最适合的模型:

  • Nemotron 3 Ultra (550B/55B) — 旗舰级性能,需要多 GPU 服务器 (H100×8 或 A100×8+),适合企业级生产环境
  • Nemotron 3 Super (120B/12B) — 高性价比,单张 H100/A100 80GB 可运行量化版本,适合中型部署
  • Nemotron 3 Nano (31.6B/3.2B) — 轻量级,消费级 GPU (RTX 3090/4090 24GB) 即可运行,适合本地开发和边缘部署

5 分钟快速上手 (以 llama.cpp 为例)

  1. 安装 llama.cpp
    git clone https://github.com/ggerganov/llama.cpp
    cd llama.cpp
    make -j$(nproc)
  2. 下载模型 (以 Nano GGUF 为例)
    # 从 Hugging Face 下载量化版本
    wget https://huggingface.co/nvidia/Nemotron-3-Nano-GGUF/resolve/main/Nemotron-3-Nano-Q4_K_M.gguf
    # 或从 ModelScope 下载 (国内更快)
    wget https://modelscope.cn/models/nvidia/Nemotron-3-Nano-GGUF/resolve/master/Nemotron-3-Nano-Q4_K_M.gguf
  3. 运行推理
    # 交互式聊天模式
    ./llama-cli -m Nemotron-3-Nano-Q4_K_M.gguf -c 32768 -p "用户: 你好\n助手:" -cnv
    
    # 服务器模式 (OpenAI 兼容 API)
    ./llama-server -m Nemotron-3-Nano-Q4_K_M.gguf -c 32768 --port 8080
  4. 测试 API
    curl http://localhost:8080/v1/chat/completions \
      -H "Content-Type: application/json" \
      -d '{
        "model": "Nemotron-3-Nano",
        "messages": [{"role": "user", "content": "用 Python 写一个快速排序"}],
        "temperature": 0.7,
        "max_tokens": 2048
      }'
提示

首次运行建议使用 -c 32768 设置上下文长度,Nemotron 3 系列支持高达 1M tokens 上下文,但需要更多内存。GGUF 量化版本在消费级显卡上推荐使用 Q4_K_M 或 Q5_K_M 平衡质量和速度。

模型选择指南

Nemotron 3 系列采用统一的 Hybrid Mamba-Transformer MoE 架构,三个规模模型共享相同的架构设计,仅在专家数量、隐藏层维度和训练数据规模上有所不同。

核心规格对比

规格 Nemotron 3 Ultra Nemotron 3 Super Nemotron 3 Nano
总参数量 550B 120B 31.6B
激活参数 55B 12B 3.2B
专家数量 256 128 64
每 Token 激活专家 4 4 4
隐藏层维度 6144 4096 2560
层数 80 (含 4 MTP) 60 (含 4 MTP) 40 (含 4 MTP)
注意力头数 48 32 20
Mamba 状态维度 256 192 128
上下文长度 1M tokens (所有模型统一)
量化格式 NVFP4, FP8, GGUF FP8, GGUF FP8, GGUF
许可证 OpenMDW-1.1 NVIDIA Nemotron Open Model License

硬件需求估算

模型 量化格式 显存需求 (单卡) 推荐部署 预估吞吐 (tokens/s)
Ultra NVFP4 (4-bit) ~280 GB (需 4×H100 80GB) NVIDIA NIM / TensorRT-LLM ~15,000 (8×H100)
FP8 ~550 GB (需 8×H100 80GB) NVIDIA NIM / Megatron-LM ~8,000 (8×H100)
BF16 ~1.1 TB (需 16×H100 80GB) 大规模集群训练/推理 ~4,000 (16×H100)
Super FP8 ~65 GB (H100 80GB / A100 80GB) vLLM / TensorRT-LLM ~3,500 (H100)
INT4 (GGUF) ~35 GB (RTX 4090 24GB + 系统内存) llama.cpp / Ollama ~45 (RTX 4090)
BF16 ~240 GB (4×A100 80GB) 多卡推理 ~1,800 (4×A100)
Nano FP8 ~18 GB (RTX 3090/4090 24GB) vLLM / TensorRT-LLM ~1,200 (RTX 4090)
INT4 (GGUF Q4_K_M) ~8 GB (RTX 3060 12GB+) llama.cpp / Ollama / 本地部署 ~85 (RTX 4090)
BF16 ~64 GB (A100 80GB / 2×RTX 4090) 单卡/双卡全精度 ~600 (A100)
显存估算说明

上述显存估算包含模型权重 + KV Cache (基于 4096 上下文) + 激活值缓冲。实际使用中,上下文越长显存占用越大。GGUF 量化版本可通过 CPU 卸载 (--split-mode layer) 在显存不足时运行,但速度会显著下降。

系统要求

最低硬件要求

组件 Nano (GGUF INT4) Super (GGUF INT4) Ultra (NVFP4/FP8)
GPU 显存 ≥ 8 GB (推荐 12 GB+) ≥ 24 GB (推荐 48 GB+) ≥ 80 GB × 4 (H100/A100)
系统内存 ≥ 16 GB ≥ 64 GB ≥ 512 GB
存储空间 ≥ 15 GB (模型 + 缓存) ≥ 60 GB ≥ 600 GB (NVMe 推荐)
CPU 现代 x86_64 / ARM64 (4 核+) 现代 x86_64 (8 核+) Intel Xeon / AMD EPYC (32 核+)
操作系统 Linux (Ubuntu 20.04+/22.04+), Windows 10/11 (WSL2 推荐), macOS 12+ (Apple Silicon)
驱动/运行时 NVIDIA Driver 535+, CUDA 12.1+, cuDNN 8.9+

软件依赖

llama.cpp

纯 C/C++ 推理引擎,支持 GGUF 格式,CPU/GPU 混合推理,跨平台无依赖

GGUF CPU 推理 Apple Silicon 量化支持
GitHub 仓库

vLLM

高吞吐推理引擎,PagedAttention,OpenAI 兼容 API,持续批处理

FP8/BF16 PagedAttention OpenAI API 分布式
GitHub 仓库

TensorRT-LLM

NVIDIA 官方高性能推理库,内核融合,FP8/INT4 量化,多 GPU 并行

NVFP4/FP8 内核融合 多 GPU 生产级
GitHub 仓库

NVIDIA NIM

生产就绪的微服务,一键部署,企业级 SLA,Kubernetes 原生

企业级 微服务 K8s 监控
NVIDIA Build

Ollama

最简单的本地运行方式,自动管理模型,内置 API 服务器

零配置 跨平台 模型管理 API 服务
官方网站

llama.cpp / GGUF 部署指南

llama.cpp 是在消费级硬件上运行 Nemotron 3 模型的最佳选择,支持 GGUF 量化格式,可在 CPU、Apple Metal、CUDA、Vulkan 等后端运行。

安装

预编译二进制 (推荐新手)

GitHub Releases 下载对应平台的预编译版本,解压即用。

从源码编译 (推荐,性能最优)

# Ubuntu/Debian
sudo apt update && sudo apt install -y build-essential cmake curl libcurl4-openssl-dev

# GPU 支持 (CUDA)
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
mkdir build && cd build
cmake .. -DGGML_CUDA=ON -DCMAKE_BUILD_TYPE=Release
cmake --build . --config Release -j$(nproc)

# Apple Silicon (Metal)
cmake .. -DGGML_METAL=ON -DCMAKE_BUILD_TYPE=Release

# 仅 CPU (AVX2 优化)
cmake .. -DCMAKE_BUILD_TYPE=Release

模型下载

模型 Hugging Face 仓库 推荐量化 文件大小
Nano nvidia/Nemotron-3-Nano-GGUF Q4_K_M, Q5_K_M, Q8_0 8-16 GB
Super nvidia/Nemotron-3-Super-GGUF Q4_K_M, Q5_K_M 35-45 GB
Ultra nvidia/Nemotron-3-Ultra-GGUF Q4_K_M (需多卡) ~140 GB

运行参数详解

参数 说明 推荐值
-m, --model 模型文件路径 必填
-c, --ctx-size 上下文窗口大小 32768 (最长 1048576)
-ngl, --gpu-layers 卸载到 GPU 的层数 -1 (全量) / 根据显存调整
-b, --batch-size 批处理大小 512 (服务器) / 256 (本地)
-ub, --ubatch-size 微批次大小 512
-fa, --flash-attn 启用 Flash Attention 开启 (CUDA 11.7+)
--mlock 锁定内存防止交换 生产环境推荐开启
--no-mmap 禁用 mmap (加快加载) 内存充足时可开启
-t, --threads CPU 线程数 物理核心数
-cb, --cont-batching 持续批处理 (服务器模式) 服务器模式必开

常用运行模式

1. 交互式聊天

./llama-cli -m Nemotron-3-Nano-Q4_K_M.gguf \
  -c 32768 -ngl 99 -fa \
  -p "用户: 你好\n助手:" \
  -cnv --color

2. OpenAI 兼容 API 服务器

./llama-server -m Nemotron-3-Nano-Q4_K_M.gguf \
  -c 32768 -ngl 99 -fa \
  --port 8080 --host 0.0.0.0 \
  --parallel 4 --cont-batching \
  --mlock --no-mmap

3. 基准测试

# 测试吞吐量
./llama-bench -m Nemotron-3-Nano-Q4_K_M.gguf -ngl 99 -fa -b 512 -ub 512

# 测试延迟
./llama-cli -m Nemotron-3-Nano-Q4_K_M.gguf -ngl 99 -fa -p "测试" -n 128 --timing

vLLM / TensorRT-LLM 部署指南

vLLM 和 TensorRT-LLM 是生产环境高吞吐推理的首选方案,支持 FP8/BF16 精度,适合 Super 和 Nano 模型的服务化部署。

vLLM 快速部署

安装

# 使用 Docker (推荐)
docker run --runtime nvidia --gpus all \
  -v ~/.cache/huggingface:/root/.cache/huggingface \
  -p 8000:8000 \
  --ipc=host \
  vllm/vllm-openai:latest \
  --model nvidia/Nemotron-3-Nano-FP8 \
  --dtype float8 \
  --max-model-len 32768 \
  --gpu-memory-utilization 0.9 \
  --tensor-parallel-size 1

原生安装

pip install vllm

# 启动服务
python -m vllm.entrypoints.openai.api_server \
  --model nvidia/Nemotron-3-Nano-FP8 \
  --dtype float8 \
  --max-model-len 32768 \
  --gpu-memory-utilization 0.9 \
  --tensor-parallel-size 1 \
  --port 8000

TensorRT-LLM 部署

TensorRT-LLM 提供极致的推理性能,适合对延迟敏感的生产环境。

# 克隆并构建
git clone https://github.com/NVIDIA/TensorRT-LLM
cd TensorRT-LLM
pip install -r requirements.txt

# 转换模型 (以 Nemotron-3-Nano 为例)
python examples/llama/convert_checkpoint.py \
  --model_dir nvidia/Nemotron-3-Nano-FP8 \
  --output_dir /tmp/nanotron_trt \
  --dtype float8 \
  --tp_size 1

# 构建引擎
trtllm-build --checkpoint_dir /tmp/nanotron_trt \
  --output_dir /tmp/nanotron_engine \
  --gemm_plugin float8 \
  --max_batch_size 8 \
  --max_input_len 4096 \
  --max_output_len 2048

# 启动 Triton 推理服务器
tritonserver --model-repository /tmp/nanotron_engine

多 GPU 张量并行

模型 最小 GPU 数 (FP8) 推荐 GPU 数 张量并行配置
Nano 1 (24GB) 1 tp=1
Super 1 (80GB) / 2 (40GB) 2-4 tp=2/4
Ultra 4 (80GB) 8 tp=8 (pipeline parallel)
提示

vLLM 的 --max-model-len 需与硬件显存匹配:Nano FP8 在 24GB 显存可设 32768,Super FP8 在 80GB 显存可设 65536,Ultra 因模型巨大通常使用 NVIDIA NIM 或 TensorRT-LLM 的多卡方案。设置过长会 OOM,建议先用 --max-model-len 8192 验证再逐步调大。

NVIDIA NIM 微服务部署

NVIDIA NIM (NVIDIA Inference Microservices) 提供生产就绪的推理微服务,支持一键部署到本地数据中心或云端,内置优化推理引擎、负载均衡与可观测性监控。

本地容器部署

# 使用 NIM 容器部署 Nemotron 3 Super
docker run --runtime nvidia --gpus all -it --rm \
  -p 8000:8000 \
  nvcr.io/nim/nvidia/nemotron-3-super:latest \
  --model nvidia/Nemotron-3-Super-FP8
云端快速体验

无需本地 GPU,可直接在 NVIDIA Build 上体验 Nemotron 3 系列模型的 API,提供免费额度,开箱即用。

调用 API

curl -X POST "https://integrate.api.nvidia.com/v1/chat/completions" \
  -H "Authorization: Bearer $NVIDIA_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "nvidia/nemotron-3-super",
    "messages": [{"role": "user", "content": "解释一下混合专家模型"}],
    "temperature": 0.7,
    "max_tokens": 1024
  }'

Ollama 本地部署

Ollama 是本地运行大模型最简单的方式,自动管理模型下载与量化,内置 OpenAI 兼容 API 服务器,适合快速体验与本地开发。

安装并运行

# macOS / Linux 一键安装
curl -fsSL https://ollama.com/install.sh | sh

# 运行 Nemotron 3 Nano (自动下载量化版本)
ollama run nemotron3:nano

# 运行 Super (需足够显存)
ollama run nemotron3:super
模型名称说明

Ollama 官方库中的 Nemotron 3 模型命名以实际发布为准,可通过 ollama search nemotron 查看可用标签与量化版本。

Docker 容器化部署

使用 Docker 部署可保证环境一致性,便于在 Kubernetes 等编排系统中水平扩展。以下以 vLLM 镜像为例。

docker-compose 示例

services:
  nemotron:
    image: vllm/vllm-openai:latest
    runtime: nvidia
    ports:
      - "8000:8000"
    environment:
      - NVIDIA_VISIBLE_DEVICES=all
    command: >
      --model nvidia/Nemotron-3-Nano-FP8
      --dtype float8
      --max-model-len 32768
      --gpu-memory-utilization 0.9
      --tensor-parallel-size 1
    deploy:
      resources:
        reservations:
          devices:
            - driver: nvidia
              count: 1
              capabilities: [gpu]

量化部署指南

量化是降低显存占用、提升推理吞吐的关键手段。Nemotron 3 系列支持 NVFP4、FP8、INT4 (GGUF) 等多种量化格式。

量化格式对比

格式压缩比质量损失适用引擎推荐场景
BF16所有研究 / 最高质量
FP8极低vLLM / TensorRT-LLM / NIM生产推理
NVFP4TensorRT-LLM / NIMUltra 多卡
GGUF Q4_K_M~4-8×低-中llama.cpp / Ollama消费级显卡
GGUF Q8_0~2×极低llama.cpp / Ollama本地高质量

GGUF 量化 (llama.cpp)

# 将 Hugging Face 权重转换为 GGUF 并量化
python convert_hf_to_gguf.py nvidia/Nemotron-3-Nano-FP8 --outfile nano-f16.gguf
./llama-quantize nano-f16.gguf Nemotron-3-Nano-Q4_K_M.gguf Q4_K_M
量化建议

Nano 推荐 Q4_K_M 起步,质量与速度均衡;Super 显存不足用 Q4_K_M,充足用 Q6_K;Ultra 走 NVFP4/FP8 多卡方案,不建议 GGUF。

微调与训练

Nemotron 3 系列支持监督微调 (SFT) 与偏好对齐 (RLHF/DPO)。Super 与 Nano 采用 NVIDIA Open Model License,允许商业用途下的微调;Ultra 采用 OpenMDW-1.1,微调需遵守其使用条款。

基于 NeMo 的 LoRA 微调

# 使用 NVIDIA NeMo 进行 LoRA 微调
python /opt/NeMo/examples/nlp/language_modeling/tuning/peft_lora_tuning.py \
  model.pretrained_model_name=nvidia/Nemotron-3-Nano-FP8 \
  model.peft.lora_tuning.adapter_dim=16 \
  trainer.devices=1 trainer.accelerator=gpu \
  exp_manager.exp_dir=./nemotron3-nano-lora
许可证限制

Ultra 模型的微调产物在分发前需确认 OpenMDW-1.1 条款;Super/Nano 依据 NVIDIA Open Model License,月活超 1 亿需申请授权。

长上下文处理

Nemotron 3 原生支持最长 1M token 的上下文窗口,采用 Mamba 状态空间层处理长序列,对超长文档检索、代码库理解与多轮对话格外友好。

模型原生上下文RoPE 外推
Nano1M无需外推
Super1M无需外推
Ultra1M无需外推
使用建议

处理超长上下文时,推理显存随序列长度增长。建议配合 vLLM 的 PagedAttention 或 TensorRT-LLM 的 KV Cache 量化,降低长序列开销。

性能调优

以下参数可显著改善吞吐与首 token 延迟 (TTFT):

  • --gpu-memory-utilization:设为 0.9~0.95 以最大化 KV Cache 容量。
  • --max-num-seqs:提高并发序列数,提升吞吐但增加显存压力。
  • --enable-prefix-caching:对共享系统提示复用 KV Cache,多轮对话收益明显。
  • --speculative-decoding:配合 MTP 头使用草稿模型,降低解码延迟。
MTP 投机解码

Nemotron 3 内置多 token 预测 (MTP) 头,可在支持投机解码的引擎中启用,显著提升生成速度而不损失质量。

OpenAI 兼容 API 参考

vLLM、TensorRT-LLM、NIM、Ollama 均提供 OpenAI 兼容接口,可直接复用现有 OpenAI SDK,仅需切换 base_urlmodel

聊天补全请求

POST /v1/chat/completions

{
  "model": "nvidia/Nemotron-3-Nano-FP8",
  "messages": [
    {"role": "system", "content": "你是一个有帮助的中文助手。"},
    {"role": "user", "content": "用一句话解释 MoE。"}
  ],
  "temperature": 0.6,
  "top_p": 0.9,
  "max_tokens": 512,
  "stream": true
}

常用参数

参数说明建议值
temperature采样随机性0.5~0.8
top_p核采样0.9
max_tokens最大生成长度512~4096
stream流式输出true

Python SDK 使用

通过 OpenAI Python SDK 连接本地或云端 Nemotron 3 服务,仅需设置 base_url 指向推理端点。

from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:8000/v1",  # 本地 vLLM / NIM
    api_key="not-needed",
)

resp = client.chat.completions.create(
    model="nvidia/Nemotron-3-Nano-FP8",
    messages=[{"role": "user", "content": "你好,介绍一下你自己。"}],
    stream=True,
)
for chunk in resp:
    if chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="")

LangChain 集成

使用 LangChain 的 ChatOpenAI 包装 Nemotron 3,即可复用 RAG、Agent、记忆等生态能力。

from langchain_openai import ChatOpenAI
from langchain_core.messages import HumanMessage

llm = ChatOpenAI(
    model="nvidia/Nemotron-3-Super-FP8",
    base_url="http://localhost:8000/v1",
    api_key="not-needed",
    temperature=0.6,
)

print(llm.invoke([HumanMessage(content="用三句话总结 MoE 的优势。")]).content)

LlamaIndex 集成

LlamaIndex 可基于 Nemotron 3 构建检索增强生成 (RAG) 应用,适合知识库问答与文档分析。

from llama_index.llms.openai import OpenAI
from llama_index.core import Settings, VectorStoreIndex, SimpleDirectoryReader

Settings.llm = OpenAI(
    model="nvidia/Nemotron-3-Nano-FP8",
    api_base="http://localhost:8000/v1",
    api_key="not-needed",
)

docs = SimpleDirectoryReader("./data").load_data()
index = VectorStoreIndex.from_documents(docs)
query_engine = index.as_query_engine()
print(query_engine.query("根据文档,Nemotron 3 的架构特点是什么?"))

基准测试参考

以下为公开评测口径的近似结果(以官方发布为准),展示 Nemotron 3 系列在主流中英文基准上的表现。

基准Nano (31.6B)Super (120B)Ultra (550B)
MMLU (英文)~78~85~90
CMMLU (中文)~76~84~88
GSM8K (数学)~80~88~93
HumanEval (代码)~72~82~89
数据说明

上述数值为示意性区间,不代表 NVIDIA 官方精确成绩;实际评测请参考各模型 HF 卡片与官方技术报告。

模型架构

Nemotron 3 采用混合 Mamba-Transformer 架构,结合 LatentMoE 稀疏专家与前馈层压缩,并引入多 token 预测 (MTP) 头用于投机解码。

  • 混合结构:Transformer 注意力层负责全局依赖,Mamba 状态空间层高效建模长序列,兼顾质量与效率。
  • LatentMoE:将专家权重以低秩潜在表示压缩,降低显存与计算开销,使超大参数量可在有限硬件上运行。
  • 多 token 预测 (MTP):一次预测多个 token,配合投机解码显著提升生成吞吐。
  • 1M 上下文:原生支持百万级 token,适合超长文档与代码库场景。
参数说明

Ultra 总参数 550B、激活 55B、256 专家;Super 总参数 120B、激活 12B、128 专家;Nano 总参数 31.6B、激活 3.2B、64 专家。激活参数远小于总参数,是 MoE 高效推理的关键。

开源许可证

三款模型采用不同许可证,使用前请仔细阅读对应条款:

模型许可证商用微调月活限制
UltraOpenMDW-1.1需遵守条款以条款为准
SuperNVIDIA Open Model License允许超 1 亿需授权
NanoNVIDIA Open Model License允许超 1 亿需授权
合规提醒

月活跃用户超过 1 亿的产品或服务,使用 Super/Nano 需向 NVIDIA 申请授权;Ultra 的分发与衍生需符合 OpenMDW-1.1。详见 关于页许可证说明

常见问题

Q1:消费级显卡能跑哪个模型?

A:Nano Q4_K_M 可在 24GB 显存(如 RTX 4090)流畅运行;Super 需 80GB 级显存(如 A100/H100);Ultra 需多卡 NVFP4 方案。

Q2:中文支持怎么样?

A:三款模型均支持中英双语,CMMLU 等中文基准表现接近英文,适合中文场景。

Q3:为什么 llama.cpp 找不到模型?

A:需先转换为 GGUF 格式并量化,或使用 Ollama 自动拉取;Ollama 库内搜索 nemotron 查看可用标签。

Q4:显存不够怎么办?

A:优先量化(FP8/Q4_K_M)、启用 KV Cache 量化、降低 --max-model-len,或使用 NVIDIA NIM 云端推理。

更新日志

版本日期说明
v1.4.02025-06补充 LangChain / LlamaIndex 集成与基准测试章节
v1.3.02025-04新增 NVIDIA NIM 与 Docker 部署指南
v1.2.02025-03新增量化格式对比与性能调优建议
v1.1.02025-02补充 Super / Nano 部署与 API 参考
v1.0.02025-01文档站首个版本,含快速开始与 Ultra 部署