中文

贝叶斯Bellman算子

机器学习 2021-06-17 v3

摘要

我们引入一种关于贝叶斯强化学习(RL)的新视角;现有方法推断转移分布或Q函数上的后验,而我们刻画Bellman算子中的不确定性。我们的贝叶斯Bellman算子(BBO)框架的动机在于如下洞见:当引入自助法(bootstrapping)时,无模型方法实际上推断的是Bellman算子而非值函数上的后验。在本文中,我们使用BBO对无模型贝叶斯RL提供严格的理论分析,以更好理解其与既有频率主义RL方法的关系。我们证明贝叶斯解与频率主义RL解一致,即使使用近似推断,并推导出收敛性质成立的条件。在经验上,我们展示由BBO框架导出的算法具有精妙的深度探索性质,使它们能够解决最先进的正则化actor-critic算法灾难性失败连续控制任务。

关键词

引用

@article{arxiv.2106.05012,
  title  = {Bayesian Bellman Operators},
  author = {Matthew Fellows and Kristian Hartikainen and Shimon Whiteson},
  journal= {arXiv preprint arXiv:2106.05012},
  year   = {2021}
}