中文

贝叶斯探索网络

机器学习 2024-06-26 v4

摘要

贝叶斯强化学习(RL)为不确定性下的序贯决策提供了一种原则性且优雅的方法。最值得注意的是,贝叶斯智能体不面临探索/利用困境,而这是频率主义方法的主要弊病。然而对无模型方法的理论理解尚显不足。在本文中,我们引入一种新颖的贝叶斯无模型表述,并首次给出分析表明无模型方法可产生贝叶斯最优策略。我们指出所有现有无模型方法所做的近似会导致策略任意程度地偏离贝叶斯最优。作为迈向无模型贝叶斯最优的第一步,我们引入贝叶斯探索网络(BEN),其利用归一化流对Bellman算子中的偶然不确定性(通过密度估计)与认知不确定性(通过变分推断)进行建模。在完全优化的极限下,BEN学习真实的贝叶斯最优策略,但如同变分期望最大化那样,部分优化使我们的方法易于处理。实证结果表明,BEN能在现有无模型方法失败的任务中学习真实的贝叶斯最优策略。

关键词

引用

@article{arxiv.2308.13049,
  title  = {Bayesian Exploration Networks},
  author = {Mattie Fellows and Brandon Kaplowitz and Christian Schroeder de Witt and Shimon Whiteson},
  journal= {arXiv preprint arXiv:2308.13049},
  year   = {2024}
}

备注

Typos fixed and provided clearer proof of Theorem 3.2