一种面向近端策略优化的带任务反馈动态裁剪方法
机器学习
2024-11-07 v3 人工智能
摘要
近端策略优化(PPO)已广泛应用于机器人学习,展现出稳定的训练性能。然而,固定的裁剪边界设置可能会限制 PPO 的性能。具体而言,没有理论证明最优裁剪边界在整个训练过程中保持不变。同时,先前的研究表明,固定的裁剪边界限制了策略的探索能力。因此,许多过往研究旨在动态调整 PPO 裁剪边界以提升其性能。然而,这些方法的目标并未与强化学习(RL)任务的目标(即最大化累积回报)直接对齐。不同于以往的裁剪方法,我们提出了一种双层近端策略优化目标,该目标能够动态调整裁剪边界,以更好地反映这些 RL 任务的偏好(最大化回报)。基于这种双层近端策略优化范式,我们引入了一种名为基于偏好的近端策略优化(Pb-PPO)的新算法。Pb-PPO 利用多臂老虎机方法来反映 RL 偏好,推荐能够最大化当前回报的 PPO 裁剪边界。因此,与采用固定裁剪边界的 PPO 相比,Pb-PPO 具有更高的稳定性和更优的性能。我们在多个环境(包括 Gym-Mujoco 和 legged-gym)的运动基准测试上对 Pb-PPO 进行了测试。此外,我们在自定义导航任务上验证了 Pb-PPO。同时,我们与使用各种固定裁剪边界和各种裁剪方法的 PPO 进行了比较。实验结果表明,与 PPO 及其变体相比,Pb-PPO 展现出更优越的训练性能。我们的代码库已发布在:https://github.com/stevezhangzA/pb_ppo
引用
@article{arxiv.2312.07624,
title = {A dynamical clipping approach with task feedback for Proximal Policy Optimization},
author = {Ziqi Zhang and Jingzehua Xu and Zifeng Zhuang and Hongyin Zhang and Jinxin Liu and Donglin wang and Shuai Zhang},
journal= {arXiv preprint arXiv:2312.07624},
year = {2024}
}