DeReason:基于难度感知的课程提高改进了通用推理的解耦 SFT-then-RL 训练
计算与语言
2026-03-13 v1
摘要
基于可验证奖励的强化学习(RLVR)已成为从事大型语言模型推理能力的强大范式,尤其在数学和编码领域。虽然最近的努力将这一范式扩展到更广泛的一般科学(STEM)领域,但这些情境下 SFT 与 RL 之间复杂的相互作用仍未得到充分探索。在本文中,我们进行受控实验,揭示了一个关键挑战:对于一般 STEM 领域,直接应用于基础模型的 RL 样本效率极低,且始终被对中等质量响应的监督微调(SFT)所超越。然而,依次进行的 SFT 后跟 RL 仍可进一步提升性能,表明这两个阶段发挥着互补的作用,以及如何在两者之间分配训练数据确实重要。因此,我们提出了 DeReason,一种基于难度的训练数据解耦策略,用于通用推理。DeReason 通过 LLM 评分估计推理强度,将训练数据划分为推理密集型和非推理密集型子集。它将广泛覆盖、非推理密集型问题分配给 SFT 以建立基础领域知识,同时保留一小部分困难问题供 RL 以培养复杂推理。我们展示了这一原则性解耦策略在顺序 SFT 和 RL 上显著优于随机划分的数据。大量实验在一般 STEM 和数学基准测试中表明,解耦课程训练显著优于 SFT-only、RL-only 和随机划分基线。我们的工作为研究 SFT 与 RL 在通用推理中的相互作用提供了系统性研究,提供了一种高效且通用的后训练配方。
引用
@article{arxiv.2603.11193,
title = {DeReason: A Difficulty-Aware Curriculum Improves Decoupled SFT-then-RL Training for General Reasoning},
author = {Hanxu Hu and Yuxuan Wang and Maggie Huan and Jannis Vamvas and Yinya Huang and Zhijiang Guo and Rico Sennrich},
journal= {arXiv preprint arXiv:2603.11193},
year = {2026}
}
备注
13 pages, 6 figures