中文

随机域中的贝叶斯策略搜索

机器学习 2020-10-02 v1 机器学习

摘要

AI 规划可视为概率模型中的推断,且概率编程已被证明能够在部分可观测域中进行策略搜索。先前工作通过马尔可夫链蒙特卡罗在确定性域中引入策略搜索,并将黑盒变分推断适配于随机域,然而并非严格贝叶斯意义下的。在本工作中,我们将随机域中的策略搜索表述为贝叶斯推断问题,并给出将此等问题编码为嵌套概率程序的方案。我们认为,用于随机域策略搜索的概率程序应涉及嵌套条件化,并给出轻量 Metropolis-Hastings(LMH)的适配以在此类程序中进行鲁棒推断。我们将所提方案应用于随机域,并表明尽管推断算法更简单且更通用,仍学到了质量相当的策略。我们相信所提出的 LMH 变体是新颖的,并可应用于更广泛一类具有嵌套条件化的概率程序。

关键词

引用

@article{arxiv.2010.00284,
  title  = {Bayesian Policy Search for Stochastic Domains},
  author = {David Tolpin and Yuan Zhou and Hongseok Yang},
  journal= {arXiv preprint arXiv:2010.00284},
  year   = {2020}
}

备注

International Conference on Probabilistic Programming (PROBPROG), 2020