中文

基于概率程序的黑盒策略搜索

机器学习 2016-08-05 v4 人工智能

摘要

在本工作中,我们探索如何将概率程序用于表征序贯决策问题中的策略。在此表述中,概率程序既是问题域又是智能体的黑盒随机模拟器。我们将经典的策略梯度技术与最近引入的黑盒变分方法相联系,后者推广到概率程序推断。我们给出了加拿大旅行者问题(Canadian traveler problem)、岩石采样(Rock Sample)以及受“猜猜谁”(Guess Who)启发的用于最优诊断的基准测试中的案例研究。每项研究都说明了程序如何利用中等数量的参数高效地表示策略。

关键词

引用

@article{arxiv.1507.04635,
  title  = {Black-Box Policy Search with Probabilistic Programs},
  author = {Jan-Willem van de Meent and Brooks Paige and David Tolpin and Frank Wood},
  journal= {arXiv preprint arXiv:1507.04635},
  year   = {2016}
}