深度强化学习中利用参数空间噪声切换各向同性与方向性探索
机器学习
2018-09-28 v2 机器学习
摘要
本文提出一种基于参数空间噪声的深度强化学习探索方法。近期研究已通过实验表明,参数空间噪声比常用的动作空间噪声带来更好的探索。先前方法设计了更新噪声分布对角协方差矩阵的方式,而未考虑噪声向量的方向及其相关性。此外,为促进策略学习,需要对噪声分布进行快速更新。我们提出一种依据累积回报及导致该回报的噪声来变形噪声分布的方法。而且,该方法就所获奖励而言在参数空间中的各向同性探索与方向性探索之间切换。我们在 OpenAI Gym 连续环境及稀疏奖励的修改环境中验证了我们的探索策略。所提方法在基线任务上取得了与先前方法相竞争的结果。此外,我们的方法通过切换策略的探索在稀疏奖励环境中表现出更优性能。
引用
@article{arxiv.1809.06570,
title = {Switching Isotropic and Directional Exploration with Parameter Space Noise in Deep Reinforcement Learning},
author = {Izumi Karino and Kazutoshi Tanaka and Ryuma Niiyama and Yasuo Kuniyoshi},
journal= {arXiv preprint arXiv:1809.06570},
year = {2018}
}
备注
16 pages, 5 figures