中文

后继不确定性:时序差分学习中的探索与不确定性

机器学习 2019-12-04 v5 机器学习

摘要

强化学习的后验采样(PSRL)是一种在强化学习中平衡探索与利用的有效方法。随机化值函数(RVF)可视为一种有前景的扩展 PSRL 的方法。然而,我们表明,大多数将 RVF 与神经网络函数逼近结合的当代算法并不具备使 PSRL 有效的性质,并且在稀疏奖励问题中可被证明会失败。此外,我们发现不确定性的传播——这一先前被认为对探索重要的 PSRL 性质——并不能排除这种失败。我们利用这些见解设计了后继不确定性(SU),一种廉价且易于实现的 RVF 算法,保留了 PSRL 的关键性质。SU 在困难的表格探索基准上极为有效。此外,在 Atari 2600 领域,它在测试的 49 个游戏中的 38 个上超越了人类表现(达到 2.09 的中位数人类归一化分数),并在其中 36 个上优于其最接近的 RVF 竞争者 Bootstrapped DQN。

关键词

引用

@article{arxiv.1810.06530,
  title  = {Successor Uncertainties: Exploration and Uncertainty in Temporal Difference Learning},
  author = {David Janz and Jiri Hron and Przemysław Mazur and Katja Hofmann and José Miguel Hernández-Lobato and Sebastian Tschiatschek},
  journal= {arXiv preprint arXiv:1810.06530},
  year   = {2019}
}

备注

Camera ready version, NeurIPS 2019