响应级奖励是LLM在线强化学习所需的一切:数学视角
机器学习
2025-06-04 v1 人工智能
计算与语言
摘要
我们研究了大语言模型(LLMs)强化学习中的一个常见挑战:零奖励假设,即非终止动作(即中间token生成)获得零任务特定即时奖励,而只有最终token获得整个响应的奖励。这种假设在实践中频繁出现,因为在LLM应用中,精确的token级奖励通常难以获得或不可行。在这项工作中,我们提供了一个统一的理论视角。我们引入了轨迹策略梯度定理,该定理表明,无论零奖励假设是否成立,对于REINFORCE和Actor-Critic系列算法,基于真实的、未知的token级奖励的策略梯度都可以仅使用响应级奖励模型进行无偏估计。这一结果揭示了诸如PPO、GRPO、ReMax和RLOO等广泛使用的方法本质上具备建模token级奖励信号的能力,为响应级奖励方法提供了理论依据。我们的发现为更实用、高效的LLM微调铺平了道路,允许开发者将训练算法视为黑盒,并专注于通过辅助子模型改进响应级奖励模型。我们还对流行的RL和非RL方法进行了详细分析,比较了它们在常见LLM任务中的理论基础和实际优势。最后,我们提出了一种新算法:Token-Reinforced Policy Optimization (TRePO),这是一种有理论依据的方法,比PPO更简单,在内存效率上与GRPO相当,并具有广泛应用的潜力。
引用
@article{arxiv.2506.02553,
title = {Response-Level Rewards Are All You Need for Online Reinforcement Learning in LLMs: A Mathematical Perspective},
author = {Shenghua He and Tian Xia and Xuan Zhou and Hui Wei},
journal= {arXiv preprint arXiv:2506.02553},
year = {2025}
}