PPO-UE:基于不确定性感知探索的近端策略优化
机器学习
2022-12-14 v1 人工智能
摘要
近端策略优化(PPO)是一种极受欢迎的基于策略的深度强化学习(DRL)方法。然而,我们观察到PPO中同质的探索过程可能在训练阶段引发意外的稳定性问题。为解决该问题,我们提出了PPO-UE,一种配备基于比率不确定性水平的自适应不确定性感知探索(UE)的PPO变体。所提出的PPO-UE旨在通过优化的比率不确定性水平提升收敛速度与性能。通过随比率不确定性水平变化的广泛敏感性分析,我们提出的PPO-UE在Roboschool连续控制任务中显著优于基线PPO。
引用
@article{arxiv.2212.06343,
title = {PPO-UE: Proximal Policy Optimization via Uncertainty-Aware Exploration},
author = {Qisheng Zhang and Zhen Guo and Audun Jøsang and Lance M. Kaplan and Feng Chen and Dong H. Jeong and Jin-Hee Cho},
journal= {arXiv preprint arXiv:2212.06343},
year = {2022}
}