中文

改进大语言模型科学推理的数据与奖励设计

计算与语言 2026-02-11 v2

摘要

解决开放式科学问题对大语言模型来说仍然具有挑战性,特别是由于固有的不可靠监督和评估。瓶颈在于科学后训练的数据构建和奖励设计。我们开发了一个大规模、系统化的数据处理流水线,将异构的开源科学数据转化为Dr. SCI数据集,该数据集包含跨越八个STEM学科的100万个问题,具有明确的可验证/开放式划分、可扩展的难度标注以及为开放式答案评估提供可操作性的细粒度评分标准。基于此数据集,我们提出了Dr. SCI后训练流水线,通过三个组件重新设计了标准的SFT -> RL工作流程:(i) 探索扩展SFT,在强化学习之前扩展模型的推理模式覆盖范围;(ii) 动态难度课程,使训练数据适应模型不断发展的科学能力;(iii) 评分标准引导的强化学习,通过基于评分标准和明确答案正确性的评估,在开放式科学问题上实现稳定的强化学习。使用Dr. SCI流水线训练的Qwen3-4B-Base在GPQA-diamond上达到63.2,在GPQA-general上达到32.4,持续优于o1-mini和GPT-4o等强大的后训练基线,展示了在科学推理方面的显著提升,尤其是在开放式场景中。

关键词

引用

@article{arxiv.2602.08321,
  title  = {Improving Data and Reward Design for Scientific Reasoning in Large Language Models},
  author = {Zijie Chen and Zhenghao Lin and Xiao Liu and Zhenzhong Lan and Yeyun Gong and Peng Cheng},
  journal= {arXiv preprint arXiv:2602.08321},
  year   = {2026}
}