中文

#探索:面向深度强化学习的基于计数探索方法研究

人工智能 2017-12-06 v3 机器学习

摘要

已知基于计数的探索算法在与表格型强化学习(RL)方法结合求解小型离散马尔可夫决策过程(MDP)时性能接近最优。通常认为,基于计数的方法无法应用于高维状态空间,因为大多数状态只会出现一次。最近的深度RL探索策略通过复杂的启发式方法能够处理高维连续状态空间,这些方法通常依赖于面对不确定性时的乐观性或内在动机。在这项工作中,我们描述了一个令人惊讶的发现:经典基于计数方法的一个简单推广能够在各种高维和/或连续的深度RL基准测试上达到接近最先进的性能。状态被映射为哈希码,从而可以使用哈希表对其出现次数进行计数。然后根据经典的基于计数探索理论,使用这些计数来计算奖励加成。我们发现简单的哈希函数可以在许多具有挑战性的任务上取得令人惊讶的良好结果。此外,我们表明,依赖于领域的可学习哈希码可以进一步改善这些结果。详细分析揭示了一个好的哈希函数的重要方面:1)具有适当的粒度,以及2)编码与求解MDP相关的信息。这种探索策略在连续控制任务和Atari 2600游戏上均达到了接近最先进的性能,从而为求解需要大量探索的MDP提供了一个简单而强大的基线。

关键词

引用

@article{arxiv.1611.04717,
  title  = {#Exploration: A Study of Count-Based Exploration for Deep Reinforcement Learning},
  author = {Haoran Tang and Rein Houthooft and Davis Foote and Adam Stooke and Xi Chen and Yan Duan and John Schulman and Filip De Turck and Pieter Abbeel},
  journal= {arXiv preprint arXiv:1611.04717},
  year   = {2017}
}

备注

10 pages main text + 10 pages supplementary. Published at NIPS 2017