中文

SUPERNOVA:基于自然指令在LLM中引导通用推理的强化学习

人工智能 2026-04-13 v1 计算与语言 机器学习

摘要

可验证奖励(RLVR)的强化学习显著提高了大语言模型(LLM)在数学和代码等形式化领域的推理能力。尽管如此,LLM仍在需要因果推断和时序理解等能力的通用推理任务中表现不佳。将RLVR扩展至通用推理根本受限于缺乏涵盖多样化推理技能的高质�可验证训练数据。为此,我们提出SUPERNOVA,这是一种面向RLVR的data curation框架,用于提升通用推理。我们的关键见解是,包含专家标注ground-truth的指令调优数据集编码了丰富的推理模式,可系统性地适应用于RLVR。为研究这一问题,我们进行了100多个受控RL实验,以分析数据设计选择对下游推理性能的影响。特别是,我们检验了三个关键因素:(i)源任务选择,(ii)任务混合策略,以及(iii)提高数据质量的synthetic干预。我们的分析表明,源任务选择是非平凡的,对下游推理性能具有显著影响。此外,基于单个目标任务的性能选择任务优于基于整体平均性能的策略。最终,基于SUPERNOVA训练的模型在挑战性推理基准测试(包括BBEH、Zebralogic和MMLU-Pro)中优于强大基线(如Qwen3.5)。特别是,针对BBEH的SUPERNOVA训练可实现最高达52.8%的相对提升,证明了为RLVR精炼人类标注资源的原则方法有效性。我们的发现为将RLVR扩展至通用推理提供了实用见解。代码和数据已公开于https://github.com/asuvarna31/supernova。

关键词

引用

@article{arxiv.2604.08477,
  title  = {SUPERNOVA: Eliciting General Reasoning in LLMs with Reinforcement Learning on Natural Instructions},
  author = {Ashima Suvarna and Kendrick Phan and Mehrab Beikzadeh and Hritik Bansal and Saadia Gabriel},
  journal= {arXiv preprint arXiv:2604.08477},
  year   = {2026}
}

备注

23 Pages, 4 figures