中文

BADDr:面向 POMDP 的贝叶斯自适应深度 Dropout 强化学习

机器学习 2022-02-21 v1 人工智能

摘要

尽管强化学习(RL)在可扩展性方面取得了巨大进展,但探索与部分可观测性仍是活跃的研究课题。相比之下,贝叶斯强化学习(BRL)为状态估计与探索-利用权衡提供了原则性的解答,但却难以扩展。为应对这一挑战,人们提出了带有不同先验假设的 BRL 框架,取得了各异的成功。本工作给出了部分可观测下 BRL 的一种表示无关的建模形式,将先前模型统一于一个理论框架之下。为彰显其实际意义,我们还提出了一种基于 dropout 网络的新推导——贝叶斯自适应深度 Dropout 强化学习(BADDr)。在此参数化下,与先前工作不同,对状态和动力学的信念是一个更具可扩展性的推断问题。我们通过蒙特卡洛树搜索选择动作,并凭经验表明,我们的方法在小型领域上与最先进的 BRL 方法具有竞争力,同时能够求解大得多的领域。

关键词

引用

@article{arxiv.2202.08884,
  title  = {BADDr: Bayes-Adaptive Deep Dropout RL for POMDPs},
  author = {Sammie Katt and Hai Nguyen and Frans A. Oliehoek and Christopher Amato},
  journal= {arXiv preprint arXiv:2202.08884},
  year   = {2022}
}