中文

PPO-UE:基于不确定性感知探索的近端策略优化

机器学习 2022-12-14 v1 人工智能

摘要

近端策略优化(PPO)是一种极受欢迎的基于策略的深度强化学习(DRL)方法。然而,我们观察到PPO中同质的探索过程可能在训练阶段引发意外的稳定性问题。为解决该问题,我们提出了PPO-UE,一种配备基于比率不确定性水平的自适应不确定性感知探索(UE)的PPO变体。所提出的PPO-UE旨在通过优化的比率不确定性水平提升收敛速度与性能。通过随比率不确定性水平变化的广泛敏感性分析,我们提出的PPO-UE在Roboschool连续控制任务中显著优于基线PPO。

关键词

引用

@article{arxiv.2212.06343,
  title  = {PPO-UE: Proximal Policy Optimization via Uncertainty-Aware Exploration},
  author = {Qisheng Zhang and Zhen Guo and Audun Jøsang and Lance M. Kaplan and Feng Chen and Dong H. Jeong and Jin-Hee Cho},
  journal= {arXiv preprint arXiv:2212.06343},
  year   = {2022}
}