中文

后继选项:一种用于强化学习的选项发现框架

机器学习 2019-05-15 v1 人工智能 机器学习

摘要

强化学习中的选项框架对技能或时间上扩展的动作序列这一概念进行建模。可复用技能集合的发现通常在于构建导航至瓶颈状态的选项。本工作采用一种互补的方法,试图发现导航至地标状态的选项。这些状态是连通良好区域的典型代表,因此可相对容易地访问相应区域。在本工作中,我们提出后继选项(Successor Options),其利用后继表示(Successor Representations)来构建状态空间模型。选项内策略使用一种新颖的伪奖励进行学习,且该模型可轻松扩展到高维空间。此外,我们还提出一种增量式后继选项模型,其在构建后继表示与构建选项之间迭代,这在无法仅从原始动作构建鲁棒后继表示时非常有用。我们在一系列网格世界以及 Fetch 的高维机器人控制环境中展示了我们方法的有效性。

关键词

引用

@article{arxiv.1905.05731,
  title  = {Successor Options: An Option Discovery Framework for Reinforcement Learning},
  author = {Rahul Ramesh and Manan Tomar and Balaraman Ravindran},
  journal= {arXiv preprint arXiv:1905.05731},
  year   = {2019}
}

备注

To appear in the proceedings of the International Joint Conference on Artificial Intelligence 2019 (IJCAI)