不确定性 Bellman 方程与探索
人工智能
2018-10-23 v4 机器学习
最优化与控制
机器学习
摘要
我们考虑强化学习中的探索/利用问题。对于利用,众所周知 Bellman 方程将任意时间步的值与后续时间步的期望值联系起来。在本文中,我们考虑一个类似的不确定性 Bellman 方程(UBE),它将任意时间步的不确定性与后续时间步的期望不确定性联系起来,从而将策略的潜在探索收益扩展到单个时间步之外。我们证明,UBE 的唯一不动点构成了由任何策略诱导的 Q 值后验分布方差的上界。这个界可以比传统的基于计数的奖励(其累积的是标准差而非方差)紧得多。重要的是,与现有的几种乐观方法不同,该方法可以自然地扩展到具有复杂泛化能力的大型系统。将我们的 UBE 探索策略替换 -greedy 后,在 Atari 套件的 57 个游戏中有 51 个游戏提升了 DQN 的性能。
关键词
引用
@article{arxiv.1709.05380,
title = {The Uncertainty Bellman Equation and Exploration},
author = {Brendan O'Donoghue and Ian Osband and Remi Munos and Volodymyr Mnih},
journal= {arXiv preprint arXiv:1709.05380},
year = {2018}
}