中文

BREAD:基于专家锚点的分支式 rollout 串联SFT与RL以提升推理能力

机器学习 2025-06-23 v1

摘要

小型语言模型(SLMs)在学习复杂推理行为方面存在挑战,尤其当高质�轨迹稀缺或难以学习时。标准训练方法包括监督微调(SFT)阶段,通常用于提炼大型模型的能力,随后是强化学习(RL)阶段,如群体相对策略优化(GRPO)。本文调查了该SFT + RL范式的根本局限,并提出方法克服其限制。在合适的理论模型下,我们证明SFT + RL策略在(1)专家轨迹对小型模型而言过于难以表达,或(2)小型模型的初始化在成功方面具有指数级小的可能性时,可能完全失败。为此,我们引入BREAD:一种GRPO变体,通过部分专家引导和分支式 rollout 统一了SFT与RL阶段。当自生成轨迹失败时,BREAD会自适应插入简短的专家前缀/提示,允许小型模型完成其余推理路径,确保每次更新至少包含一条成功轨迹。该机制既稠密化了奖励信号,又诱导出天然的学习课程。BREAD所需的地面真相轨迹不足40%,持续优于标准GRPO,同时加快训练约3倍。重要的是,我们展示BREAD帮助模型解决其他SFT + RL策略无法解决的问题,凸显分支式 rollout 和专家引导如何显著提升SLM推理能力。

关键词

引用

@article{arxiv.2506.17211,
  title  = {BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning},
  author = {Xuechen Zhang and Zijian Huang and Yingcong Li and Chenshun Ni and Jiasi Chen and Samet Oymak},
  journal= {arXiv preprint arXiv:2506.17211},
  year   = {2025}
}