基于离-policy 指导的推理学习
机器学习
2025-06-24 v5 人工智能
计算与语言
摘要
近期大规模推理模型 (LRM) 的进展表明,多步推理和自我反思等高级行为可以通过基于可验证奖励的强化学习 (RLVR) 逐渐涌现。然而,现有的 RLVR 方法天然属于 on-policy,这限制了学习仅限于模型自身的输出,无法获得超出初始能力的推理能力。为此,本文引入 LUFFY (Learning to reason Under Off-policy Guidance),即学习基于离policy 指导的推理框架,旨在增强 RLVR 的离policy 推理轨迹。LUFFY 通过将离policy 示范与 on-policy rollout 结合训练,动态平衡模仿与探索。具体而言,LUFFY 结合 Mixed-Policy GRPO 框架,该框架具有理论保证的收敛速率,同时通过正则化重要性抽样实现政策塑形,以避免混合政策训练中的浅薄和僵化模仿。与以往 RLVR 方法相比,LUFFY 在六个数学基准测试中实现超过 +6.4 的平均提升,在离分布任务中取得 +6.2 分的优势。最重要的是,我们展示 LUFFY 在 on-policy RLVR 完全失败的场景下成功训练弱模型。这些结果为 LUFFY 超越 on-policy RLVR 本质局限提供了有力证据,证明了利用离policy 指导在 RLVR 中具有巨大的潜力。
关键词
引用
@article{arxiv.2504.14945,
title = {Learning to Reason under Off-Policy Guidance},
author = {Jianhao Yan and Yafu Li and Zican Hu and Zhi Wang and Ganqu Cui and Xiaoye Qu and Yu Cheng and Yue Zhang},
journal= {arXiv preprint arXiv:2504.14945},
year = {2025}
}
备注
Work in progress