中文

Nemotron-CrossThink:超越数学推理的自学习扩展框架

机器学习 2026-03-17 v3 人工智能

摘要

大型语言模型(LLM)在强化学习(RL)提升后,展现出强大的推理能力,尤其在数学推理方面表现突出——该领域规则明确且正确性可验证。然而,将这些方法推广到更广泛的推理领域仍具挑战性,主要因数据有限、奖励结构难以验证以及任务需求多样。本文提出NEMOTRON-CROSSTHINK框架,通过系统性地将多领域语料库(包括合成数据和真实问答对)纳入RL训练,提升跨任务推理的泛化能力。NEMOTRON-CROSSTHINK通过(1)整合STEM、人文、社会科学等多样来源的数据;(2)应用结构化模板(如多选题和开放题)控制答案空间复杂度;(3)筛选可验证答案;(4)优化数据混合策略,有效利用多源数据。我们的 approach 使超越数学的可扩展且可验证奖励建模成为可能,在数学(MATH-500:+30.1%,AMC23:+27.5%)和非数学推理基准(MMLU-PRO:+12.8%,GPQA-DIAMOND:+11.3%,AGIEVAL:+15.1%,SUPERGPQA:+3.8%)上均实现提升。此外,NEMOTRON-CROSSTHINK显著提升响应效率——正确答案所需token数降低28%,体现更聚焦且高效的推理。通过NEMOTRON-CROSSTHINK,我们展示了在RL中集成多领域、多格式数据,能构建更准确、更高效且更具泛化性的大型语言模型。

关键词

引用

@article{arxiv.2504.13941,
  title  = {Nemotron-CrossThink: Scaling Self-Learning beyond Math Reasoning},
  author = {Syeda Nahida Akter and Shrimai Prabhumoye and Matvei Novikov and Seungju Han and Ying Lin and Evelina Bakhturina and Eric Nyberg and Yejin Choi and Mostofa Patwary and Mohammad Shoeybi and Bryan Catanzaro},
  journal= {arXiv preprint arXiv:2504.13941},
  year   = {2026}
}

备注

19 pages, 10 figures