中文

良好 SFT 优化 SFT,更好的 SFT 为强化学习做准备

机器学习 2026-05-29 v2 人工智能 计算与语言

摘要

推理 LLM 的后训练是一个整体过程,通常包含离线 SFT 阶段 followed by 在线强化学习(RL)阶段。然而,SFT 常以孤立方式优化,以仅最大化 SFT 性能为目标。我们发现,经过相同的 RL 训练后,初始化于更强 SFT 检查点的模型,与初始化于较弱 SFT 检查点的模型相比,显著落后。我们将其归因于当前 SFT-RL 流程中常见的分布失配:生成离线 SFT 数据的分布可能与在线 RL 中优化的策略差异显著,而后者学习自身 rollout。我们提出 PEAR(基于策略评估的离线学习损失重加权算法),一种 SFT 阶段的方法,用于纠正此失配并更好地为模型准备 RL。PEAR 使用重要性抽样重新加权 SFT 损失,包含三个变体分别在 token、block 和序列级别操作。可用于增强标准 SFT 目标,且一旦收集离线数据的概率,一旦收集离线数据的概率,额外训练开销很小。我们在可验证推理游戏和数学推理任务上对 Qwen 2.5 和 3 以及 DeepSeek-distilled 模型进行控制实验。PEAR 在所有实验中均一致提升了后 RL 性能,AIME2025 的 pass at 8 提升最高可达 14.6 百分点。我们的结果表明,PEAR 是一种有效的步骤,旨在通过设计和评估 SFT 以关注下游 RL 而非孤立方式,实现更整体的 LLM 后训练。

关键词

引用

@article{arxiv.2602.01058,
  title  = {Good SFT Optimizes for SFT, Better SFT Prepares for Reinforcement Learning},
  author = {Dylan Zhang and Yufeng Xu and Haojin Wang and Qingzhi Chen and Hao Peng},
  journal= {arXiv preprint arXiv:2602.01058},
  year   = {2026}
}