中文

残差策略梯度:KL 正则化目标的奖励视角

机器学习 2025-05-26 v2

摘要

强化学习和模仿学习在许多领域取得了广泛成功,但在实际部署中仍受到限制。主要问题之一是训练期间未考虑到的额外要求。为了应对这一挑战,人们引入了策略定制,旨在调整先验策略的同时保留其固有属性并满足新的任务特定要求。策略定制的一种原则性方法是残差 Q 学习(RQL),它将问题表述为马尔可夫决策过程(MDP)并推导出一族基于价值的学习算法。然而,RQL 尚未应用于策略梯度方法,这限制了其适用性,尤其是在策略梯度已被证明更有效的任务中。在这项工作中,我们首先推导出软策略梯度的简洁形式作为基础。在此基础上,我们引入了残差策略梯度(RPG),将 RQL 扩展到策略梯度方法,允许在基于梯度的强化学习环境中进行策略定制。通过 RPG 的视角,我们重新思考了强化学习微调中广泛使用的 KL 正则化目标。我们表明,在某些假设下,KL 正则化目标会导出一个在奖励级别上平衡固有属性和任务特定要求的最大熵策略。我们在 MuJoCo 中的实验证明了软策略梯度和残差策略梯度的有效性。

关键词

引用

@article{arxiv.2503.11019,
  title  = {Residual Policy Gradient: A Reward View of KL-regularized Objective},
  author = {Pengcheng Wang and Xinghao Zhu and Yuxin Chen and Chenfeng Xu and Masayoshi Tomizuka and Chenran Li},
  journal= {arXiv preprint arXiv:2503.11019},
  year   = {2025}
}