中文

不确定性 Bellman 方程与探索

人工智能 2018-10-23 v4 机器学习 最优化与控制 机器学习

摘要

我们考虑强化学习中的探索/利用问题。对于利用,众所周知 Bellman 方程将任意时间步的值与后续时间步的期望值联系起来。在本文中,我们考虑一个类似的不确定性 Bellman 方程(UBE),它将任意时间步的不确定性与后续时间步的期望不确定性联系起来,从而将策略的潜在探索收益扩展到单个时间步之外。我们证明,UBE 的唯一不动点构成了由任何策略诱导的 Q 值后验分布方差的上界。这个界可以比传统的基于计数的奖励(其累积的是标准差而非方差)紧得多。重要的是,与现有的几种乐观方法不同,该方法可以自然地扩展到具有复杂泛化能力的大型系统。将我们的 UBE 探索策略替换 ϵ\epsilon-greedy 后,在 Atari 套件的 57 个游戏中有 51 个游戏提升了 DQN 的性能。

关键词

引用

@article{arxiv.1709.05380,
  title  = {The Uncertainty Bellman Equation and Exploration},
  author = {Brendan O'Donoghue and Ian Osband and Remi Munos and Volodymyr Mnih},
  journal= {arXiv preprint arXiv:1709.05380},
  year   = {2018}
}