中文

Nemotron-Math:来自多模态监督的高效长上下文数学推理蒸馏

人工智能 2025-12-18 v1

摘要

高质量的数学推理监督需要多样化的推理风格、长轨迹和有效的工具集成,而现有数据集仅以有限形式提供这些能力。利用 gpt-oss-120b 的多模态生成能力,我们引入 Nemotron-Math,一个大规模的数学推理数据集,包含 750 万条解决方案轨迹,涵盖高、中、低推理模式,每种模式均有和没有 Python 工具集成推理(TIR)的版本。该数据集整合了 85K 经筛选的 AoPS 问题与 262K 社区来源的 StackExchange-Math 问题,将结构化的竞赛任务与多样化的真实数学查询相结合。我们进行了受控评估以检验数据集质量。Nemotron-Math 在匹配的 AoPS 问题上始终优于原始 OpenMathReasoning。纳入 StackExchange-Math 大幅提升了鲁棒性和泛化能力,尤其在 HLE-Math 上,同时保持了数学竞赛基准上的准确性。为支持高效的长上下文训练,我们开发了一种顺序分桶策略,将 128K 上下文长度微调加速 2–3×\times 而无明显精度损失。总体而言,Nemotron-Math 实现了最先进的性能,包括在 AIME 2024 和 2025 上使用 Python TIR 达到 100% maj@16 准确率。

关键词

引用

@article{arxiv.2512.15489,
  title  = {Nemotron-Math: Efficient Long-Context Distillation of Mathematical Reasoning from Multi-Mode Supervision},
  author = {Wei Du and Shubham Toshniwal and Branislav Kisacanin and Sadegh Mahdavi and Ivan Moshkov and George Armstrong and Stephen Ge and Edgar Minasyan and Feng Chen and Igor Gitman},
  journal= {arXiv preprint arXiv:2512.15489},
  year   = {2025}
}