中文

超越两阶段训练:面向 LLM 推理的 SFT 与 RL 协同

计算与语言 2025-10-17 v2

摘要

强化学习(RL)已被证明能有效激发大语言模型(LLM)的推理能力,但由于其试错特性而面临严重的效率挑战。虽然常见做法将监督微调(SFT)作为 RL 的预热阶段,但这种解耦的两阶段方法存在灾难性遗忘问题:第二阶段的 RL 逐渐丧失 SFT 习得的行为,并低效地探索新模式。本研究引入了一种学习推理模型的新方法,采用双层优化以促进这些训练范式之间更好的协同。通过将 SFT 目标条件化于最优 RL 策略,我们的方法使 SFT 能够元学习如何引导 RL 的优化过程。在训练期间,下层执行 RL 更新并同时接受 SFT 监督,上层显式地最大化协同增益——即 SFT-RL 联合训练相对于单独 RL 的性能优势。在五个推理基准上的实证评估表明,我们的方法持续优于基线,并在有效性与效率之间取得了更好的平衡。

关键词

引用

@article{arxiv.2509.06948,
  title  = {Beyond Two-Stage Training: Cooperative SFT and RL for LLM Reasoning},
  author = {Liang Chen and Xueting Han and Li Shen and Jing Bai and Kam-Fai Wong},
  journal= {arXiv preprint arXiv:2509.06948},
  year   = {2025}
}