中文

非策略强化学习中的非对称REINFORCE:平衡正负奖励

机器学习 2025-12-01 v2 计算与语言

摘要

强化学习(RL)日益用于大型语言模型(LLMs)的对齐。相较于基于策略的方法,离策略方法在实现简单性和数据效率方面具有优势,但常导致次优性能。本文通过分析一种简单的离策略REINFORCE算法来研究介于离策略RL与监督微调之间的算法,其中优势定义为 A=rVA=r-V,其中 rr 为奖励,VV 为可调基线。直观地说,降低 VV 强调高奖励样本,而提高它则更严厉地惩罚低奖励样本。我们首先对该离策略REINFORCE算法进行理论分析,表明当基线 VV 位于预期奖励的下界时,该算法具有策略改进保证。我们的分析揭示,虽然基于策略的更新可以安全地利用正负信号,但离策略更新受益于更关注正奖励而非负奖励。我们在受控随机赌博机设置中进行实验验证,并通过在推理任务上对最先进的LLMs进行微调来验证我们的发现。

关键词

引用

@article{arxiv.2506.20520,
  title  = {Asymmetric REINFORCE for off-Policy Reinforcement Learning: Balancing positive and negative rewards},
  author = {Charles Arnal and Gaëtan Narozniak and Vivien Cabannes and Yunhao Tang and Julia Kempe and Remi Munos},
  journal= {arXiv preprint arXiv:2506.20520},
  year   = {2025}
}