中文

DORA The Explorer:定向外展强化动作选择

机器学习 2018-04-12 v1 人工智能 机器学习

摘要

探索是强化学习的基本方面,通常通过随机动作选择来实现。然而,若能将探索导向获取新的世界知识,则可更为高效。访问计数器已被证明在理论与实践上对定向探索均有益处。但计数器的一个主要局限在于其局部性。尽管已有少数基于模型的方案解决此缺陷,仍缺乏无模型方法。我们提出 EE-values,一种计数器的推广,可用于评估沿状态-动作轨迹传播的探索价值。我们将本方法与常用 RL 技术比较,表明使用 EE-values 相较传统计数器改善了学习与性能。我们还展示了如何通过函数逼近实现本方法以高效学习连续 MDP。我们通过表明本方法在 Freeway Atari 2600 游戏中超越最先进性能来演示这一点。

关键词

引用

@article{arxiv.1804.04012,
  title  = {DORA The Explorer: Directed Outreaching Reinforcement Action-Selection},
  author = {Leshem Choshen and Lior Fox and Yonatan Loewenstein},
  journal= {arXiv preprint arXiv:1804.04012},
  year   = {2018}
}

备注

Final version for ICLR 2018