中文

强化学习中用于选项发现的拉普拉斯框架

机器学习 2017-06-19 v2 人工智能

摘要

表示学习和选项发现是强化学习(RL)中的两大挑战。原型值函数(PVFs)是 MDP 中表示学习的一种著名方法。在本文中,我们通过展示 PVFs 如何隐式定义选项来解决选项发现问题。我们通过引入特征目的(eigenpurposes,从学习到的表示中导出的内在奖励函数)来实现这一点。从特征目的中发现的选项遍历状态空间的主方向。它们对多种任务有用,因为它们的发现未考虑环境的奖励。此外,不同的选项在不同的时间尺度上起作用,使其对探索有所帮助。我们在传统表格域以及 Atari 2600 游戏中展示了特征目的的特性。

关键词

引用

@article{arxiv.1703.00956,
  title  = {A Laplacian Framework for Option Discovery in Reinforcement Learning},
  author = {Marlos C. Machado and Marc G. Bellemare and Michael Bowling},
  journal= {arXiv preprint arXiv:1703.00956},
  year   = {2017}
}

备注

Appearing in the Proceedings of the 34th International Conference on Machine Learning (ICML)