中文

Light-R1:从零开始进行长程推理训练的课程SFT、DPO与RL

计算与语言 2025-05-29 v4 机器学习

摘要

本文介绍Light-R1,这是一个用于训练长推理模型的开源套件,采用可重复且高性价比的方法。鉴于DeepSeek-R1系列中使用的资料的专有属性,我们发展了一种仅依赖公开资料和模型的替代方法。我们的课程训练逐步增加数据难度,结合多阶段后训练。我们的Light-R1-32B模型,基于Qwen2.5-32B-Instruct训练, 在数学推理方面超过DeepSeek-R1-Distill-Qwen-32B。实验结果表明,随着不同训练阶段可获得的独特且多样化数据集的增加,课程方法的效果更为显著:对DeepSeek-R1-Distilled模型进行精调(这些模型已在专有资料上预调),使用来自我们课程数据集的3000个具备挑战性的示例,即可获得最先进的7B和14B模型;而32B模型Light-R1-32B-DS的表现相当于QwQ-32B和DeepSeek-R1。此外,我们通过在长推理模型上应用GRPO来延伸我们的工作。我们的最终模型Light-R1-14B-DS在数学推理方面达到14B模型的最高水平,AIME24与25的得分为74.0和60.2,超过许多32B模型和DeepSeek-R1-Distill-Llama-70B。尽管以数学为焦点训练,Light-R1-14B-DS仍显示出强大的跨领域泛化能力。Light-R1代表了在使复杂推理模型更具可及性和在实际应用中可实现性方面的重大进展。我们的模型、训练数据和代码已在https://github.com/Qihoo360/Light-R1上公开。

关键词

引用

@article{arxiv.2503.10460,
  title  = {Light-R1: Curriculum SFT, DPO and RL for Long COT from Scratch and Beyond},
  author = {Liang Wen and Yunke Cai and Fenrui Xiao and Xin He and Qi An and Zhenyu Duan and Yimin Du and Junchen Liu and Lifu Tang and Xiaowei Lv and Haosheng Zou and Yongchao Deng and Shousheng Jia and Xiangzheng Zhang},
  journal= {arXiv preprint arXiv:2503.10460},
  year   = {2025}
}

备注

v4: ACL'25 industry track camera ready; v3: minor modifications; v2: better writing & format for later submission; all release at https://github.com/Qihoo360/Light-R1