基于对称相对密度比自适应阈值的近端策略优化
机器学习
2023-07-04 v1
摘要
深度强化学习(DRL)是使机器人进入复杂环境的有前景的方法之一。DRL 近期的显著进展建立在策略正则化之上,其使策略能够稳定且高效地改进。一种流行的方法,即所谓的近端策略优化(PPO)及其变体,在密度比超过给定阈值时约束最新策略与基线策略的密度比。该阈值可相对直观地设计,事实上其推荐取值范围已被提出。然而,密度比相对于其中心是非对称的,且其相对于中心的可能误差尺度(应接近阈值)取决于基线策略的给出方式。为最大化策略正则化的价值,本文提出一种利用相对 Pearson(RPE)散度导出的新 PPO,即所谓的 PPO-RPE,以自适应地设计阈值。在 PPO-RPE 中,具有对称性的相对密度比替代了原始密度比。得益于该对称性,其相对于中心的误差尺度易于估计,因此阈值可针对估计的误差尺度进行自适应。通过三个简单基准仿真,揭示了算法相关阈值设计的重要性。通过额外四个运动任务的仿真,验证了所提方法通过适当限制策略更新在统计上有助于任务完成。
引用
@article{arxiv.2203.09809,
title = {Proximal Policy Optimization with Adaptive Threshold for Symmetric Relative Density Ratio},
author = {Taisuke Kobayashi},
journal= {arXiv preprint arXiv:2203.09809},
year = {2023}
}
备注
12 pages, 9 figures