中文

基于密度估计的好奇心驱动经验优先级排序

机器学习 2020-05-27 v3 人工智能 机器学习

摘要

在强化学习(RL)中,智能体探索环境并将轨迹收集到记忆缓冲中供后续学习。然而,所收集轨迹就已达到的目标状态而言很容易失衡。从不平衡数据学习的问题是监督学习中众所周知的问题,但在 RL 中尚未被深入研究。为解决该问题,我们提出一种新颖的好奇心驱动优先级排序(CDP)框架,以鼓励智能体对那些具有稀有已达目标状态的轨迹进行过采样。CDP 框架模仿人类学习过程,并更关注相对不常见的事件。我们使用 OpenAI Gym 提供的机器人环境评估我们的方法。该环境包含六项机器人操作任务。在我们的实验中,我们将 CDP 与带或不带后见经验回放(HER)的深度确定性策略梯度(DDPG)相结合。实验结果表明,与最先进的方法相比,CDP 提升了强化学习智能体的性能与样本效率。

关键词

引用

@article{arxiv.1902.08039,
  title  = {Curiosity-Driven Experience Prioritization via Density Estimation},
  author = {Rui Zhao and Volker Tresp},
  journal= {arXiv preprint arXiv:1902.08039},
  year   = {2020}
}

备注

Accepted by NIPS Deep RL Workshop, 2018, link: https://sites.google.com/view/deep-rl-workshop-nips-2018 . arXiv admin note: substantial text overlap with arXiv:1810.01363 and text overlap with arXiv:1905.08786