通过增强探索效率实现近端策略优化
机器学习
2020-11-12 v1
摘要
近端策略优化(PPO)算法是一种性能出色的深度强化学习算法,尤其在连续控制任务中。但该方法的性能仍受其探索能力影响。对于经典强化学习,存在一些使探索与数据利用更充分且均衡的方案,但因算法复杂性而无法应用于复杂环境。基于具有稠密奖励的连续控制任务,本文分析了 PPO 算法中原始高斯动作探索机制的假设,并阐明了探索能力对性能的影响。随后,针对探索问题,本文设计了一种基于不确定性估计的探索增强机制。接着,我们将探索增强理论应用于 PPO 算法,提出可用于复杂环境的带内在探索模块近端策略优化算法(IEM-PPO)。在实验部分,我们在 MuJoCo 物理模拟器的多个任务上评估了所提方法,并将 IEM-PPO 算法与好奇心驱动探索算法(ICM-PPO)及原始算法(PPO)进行比较。实验结果表明,IEM-PPO 算法需要更长训练时间,但在样本效率与累积奖励方面表现更优,且具有稳定性与鲁棒性。
引用
@article{arxiv.2011.05525,
title = {Proximal Policy Optimization via Enhanced Exploration Efficiency},
author = {Junwei Zhang and Zhenghao Zhang and Shuai Han and Shuai Lü},
journal= {arXiv preprint arXiv:2011.05525},
year = {2020}
}
备注
34 pages, 8 figures