基于密度估计的好奇心驱动经验优先级排序
机器学习
2020-05-27 v3 人工智能
机器学习
摘要
在强化学习(RL)中,智能体探索环境并将轨迹收集到记忆缓冲中供后续学习。然而,所收集轨迹就已达到的目标状态而言很容易失衡。从不平衡数据学习的问题是监督学习中众所周知的问题,但在 RL 中尚未被深入研究。为解决该问题,我们提出一种新颖的好奇心驱动优先级排序(CDP)框架,以鼓励智能体对那些具有稀有已达目标状态的轨迹进行过采样。CDP 框架模仿人类学习过程,并更关注相对不常见的事件。我们使用 OpenAI Gym 提供的机器人环境评估我们的方法。该环境包含六项机器人操作任务。在我们的实验中,我们将 CDP 与带或不带后见经验回放(HER)的深度确定性策略梯度(DDPG)相结合。实验结果表明,与最先进的方法相比,CDP 提升了强化学习智能体的性能与样本效率。
引用
@article{arxiv.1902.08039,
title = {Curiosity-Driven Experience Prioritization via Density Estimation},
author = {Rui Zhao and Volker Tresp},
journal= {arXiv preprint arXiv:1902.08039},
year = {2020}
}
备注
Accepted by NIPS Deep RL Workshop, 2018, link: https://sites.google.com/view/deep-rl-workshop-nips-2018 . arXiv admin note: substantial text overlap with arXiv:1810.01363 and text overlap with arXiv:1905.08786