中文

用于离线强化学习的未来策略近似改进数学推理

计算与语言 2026-04-06 v2

摘要

强化学习(RL)已成为大型语言模型(LLMs)复杂推理后训练的关键驱动因素,然而在线RL引入了显著的不稳定性和计算开销。离线RL通过将推理与训练解耦,提供了一个有吸引力的替代方案;然而,用于推理的离线算法相比其在线对应方法仍不够优化。一个核心挑战是梯度纠缠:在长视野推理轨迹中,正确和错误的解共享大量token重叠,导致来自错误轨迹的梯度更新抑制了对正确解至关重要的token。我们提出了未来策略近似(FPA),一种通过相对于未来策略的估计而非当前策略来加权梯度的简单方法,从而实现主动的梯度重加权。该未来策略通过logit空间外推进行估计,开销可忽略不计。我们通过乐观镜像下降的视角为FPA提供了理论直觉,并通过其与DPO的联系进一步奠定其基础。在三个模型和七个数学基准上的评估表明,FPA在DPO、RPO、KTO和vanilla离线RL等强离线基线上始终取得改进。FPA在vanilla目标退化时稳定了长视野训练,并以在线RLVR一小部分GPU小时数达到了可比的准确率。

关键词

引用

@article{arxiv.2509.19893,
  title  = {Future Policy Approximation for Offline Reinforcement Learning Improves Mathematical Reasoning},
  author = {Minjae Oh and Yunho Choi and Dongmin Choi and Yohan Jo},
  journal= {arXiv preprint arXiv:2509.19893},
  year   = {2026}
}

备注

9 pages