中文

Nemotron-Cascade 2:基于级联RL与多域在策略蒸馏的后训练大语言模型

计算与语言 2026-03-24 v2 人工智能 机器学习

摘要

我们介绍Nemotron-Cascade 2,一个拥有300亿参数的混合专家模型,激活参数为30亿,展现出顶级推理能力和强大的代理能力。尽管模型规模紧凑,其数学和编程推理性能已接近前沿开源模型。它是继DeepSeekV3.2-Speciale-671B-A37B之后,第二个实现2025年国际数学奥林匹克(IMO)、国际信息奥林匹克(IOI)和ICPC世界决赛金 medal的开源大语言模型,展现出20倍参数效率的极高智能密度。在与Nemotron-Cascade 1相比,关键技术进步如下:在精心筛选的数据集上进行SFT后,我们大幅扩展了级联RL的覆盖范围,涵盖更广泛的推理和代理领域。此外,我们引入了来自级联RL过程中每个领域最强中间教师模型的多域在策略蒸馏,使我们能够高效地恢复基准测试中的性能退化,同时保持强大的性能提升。我们发布了模型检查点和训练数据的完整集合。

关键词

引用

@article{arxiv.2603.19220,
  title  = {Nemotron-Cascade 2: Post-Training LLMs with Cascade RL and Multi-Domain On-Policy Distillation},
  author = {Zhuolin Yang and Zihan Liu and Yang Chen and Wenliang Dai and Boxin Wang and Sheng-Chieh Lin and Chankyu Lee and Yangyi Chen and Dongfu Jiang and Jiafan He and Renjie Pi and Grace Lam and Nayeon Lee and Alexander Bukharin and Mohammad Shoeybi and Bryan Catanzaro and Wei Ping},
  journal= {arXiv preprint arXiv:2603.19220},
  year   = {2026}
}

备注

We release the model and data at https://huggingface.co/collections/nvidia/nemotron-cascade-2