中文

相对熵路径政策优化

机器学习 2026-04-14 v4

摘要

基于得分函数的方法用于策略学习,如 REINFORCE 和 PPO,已在游戏对弈和机器人领域取得优异成绩,但其高方差常常削弱训练稳定性。使用路径wise 策略梯度,即通过对目标函数求导来计算导数,可缓解方差问题。然而,这些方法需要精确的动作条件价值函数,而这在不依赖重放缓冲区复用过去的离策略数据的情况下极难学习。我们提出了一种基于策略的算法,通过仅从基于策略的轨迹训练 Q 值模型,实现了在基于策略学习中使用路径wise 策略更新的可能性。我们展示了如何将用于探索的随机策略与用于稳定训练的受限更新相结合,并评估了稳定价值函数学习的重要架构组件。结果是一种高效的基于策略算法,即相对熵路径wise 策略优化(REPPO),它将路径wise 策略梯度的稳定性与标准基于策略学习的简单性和最小内存占用相结合。与两个标准 GPU 并行化基准的当前最先进方法相比,REPPO 在样本效率、墙钟时间、内存占用和超参数鲁棒性方面均表现出色。

关键词

引用

@article{arxiv.2507.11019,
  title  = {Relative Entropy Pathwise Policy Optimization},
  author = {Claas Voelcker and Axel Brunnbauer and Marcel Hussing and Michal Nauman and Pieter Abbeel and Eric Eaton and Radu Grosu and Amir-massoud Farahmand and Igor Gilitschenski},
  journal= {arXiv preprint arXiv:2507.11019},
  year   = {2026}
}