中文

推断归纳:一种新颖的贝叶斯强化学习框架

机器学习 2020-07-03 v2 机器学习

摘要

贝叶斯强化学习(BRL)为强化学习提供了一种决策论意义上的解决方案。虽然“基于模型”的 BRL 算法要么侧重于在模型或价值函数上维持后验分布,并将其与近似动态规划或树搜索相结合,但以往的贝叶斯“无模型”价值函数分布方法隐式地做出了强假设或近似。我们描述了一种新颖的贝叶斯框架——推断归纳(Inferential Induction),用于从数据中正确推断价值函数分布,并由此发展出一类新的 BRL 算法。我们基于该框架设计了一种名为贝叶斯逆向归纳(Bayesian Backwards Induction)的算法。实验表明,所提算法与当前最优方法相比具有竞争力。

关键词

引用

@article{arxiv.2002.03098,
  title  = {Inferential Induction: A Novel Framework for Bayesian Reinforcement Learning},
  author = {Hannes Eriksson and Emilio Jorge and Christos Dimitrakakis and Debabrota Basu and Divya Grover},
  journal= {arXiv preprint arXiv:2002.03098},
  year   = {2020}
}

备注

28 pages, 12 figures