中文

强化学习中基于特征空间计数的探索

人工智能 2017-06-27 v1

摘要

我们引入了一种新的基于计数的乐观探索算法,用于强化学习 (RL),该算法在高维状态-动作空间的环境中是可行的。RL 算法在这些领域中的成功关键取决于从有限训练经验中进行泛化。函数逼近技术使 RL 智能体能够进行泛化以估计未访问状态的价值,但目前很少有方法能够针对不确定性进行泛化。这阻碍了可扩展 RL 算法与驱动智能体降低其不确定性的高效探索策略的结合。我们提出了一种计算广义状态访问计数的新方法,允许智能体估计与任何状态相关的不确定性。我们的 ϕ\phi-伪计数通过利用用于价值函数逼近的相同状态空间特征表示来实现泛化。具有较少观测特征的状态被认为更具不确定性。ϕ\phi-探索奖励算法奖励智能体在特征空间而非未变换状态空间中进行探索。该方法比以往的一些提案更简单且计算成本更低,并在高维 RL 基准测试中取得了接近 SOTA 的结果。

关键词

引用

@article{arxiv.1706.08090,
  title  = {Count-Based Exploration in Feature Space for Reinforcement Learning},
  author = {Jarryd Martin and Suraj Narayanan Sasikumar and Tom Everitt and Marcus Hutter},
  journal= {arXiv preprint arXiv:1706.08090},
  year   = {2017}
}

备注

Conference: Twenty-sixth International Joint Conference on Artificial Intelligence (IJCAI-17), 8 pages, 1 figure