中文

增大动作间隙:强化学习的新算子

人工智能 2015-12-16 v1 机器学习

摘要

本文引入关于 Q-函数的新保最优性算子。我们首先描述一种用于表格表示的算子——一致贝尔曼算子(consistent Bellman operator),其融入了局部策略一致性的概念。我们表明,该局部一致性导致每个状态下动作间隙(action gap)的增大;我们认为,增大此间隙可缓解近似与估计误差对导出的贪婪策略的不良影响。该算子亦可应用于离散化连续空间与时间问题,我们提供了在此情形下性能更优的实证结果。扩展局部一致算子的思想,我们进而推导出算子保持最优性的充分条件,从而得到一族包含我们的一致贝尔曼算子的算子。作为推论,我们给出了贝尔德(Baird)优势学习算法的最优性证明,并推导出其他具有有趣性质的增间隙算子。最后,我们在 60 个 Atari 2600 游戏上的实证研究说明了这些新算子的强大潜力。

关键词

引用

@article{arxiv.1512.04860,
  title  = {Increasing the Action Gap: New Operators for Reinforcement Learning},
  author = {Marc G. Bellemare and Georg Ostrovski and Arthur Guez and Philip S. Thomas and Rémi Munos},
  journal= {arXiv preprint arXiv:1512.04860},
  year   = {2015}
}