基于概率程序的黑盒策略搜索
机器学习
2016-08-05 v4 人工智能
摘要
在本工作中,我们探索如何将概率程序用于表征序贯决策问题中的策略。在此表述中,概率程序既是问题域又是智能体的黑盒随机模拟器。我们将经典的策略梯度技术与最近引入的黑盒变分方法相联系,后者推广到概率程序推断。我们给出了加拿大旅行者问题(Canadian traveler problem)、岩石采样(Rock Sample)以及受“猜猜谁”(Guess Who)启发的用于最优诊断的基准测试中的案例研究。每项研究都说明了程序如何利用中等数量的参数高效地表示策略。
引用
@article{arxiv.1507.04635,
title = {Black-Box Policy Search with Probabilistic Programs},
author = {Jan-Willem van de Meent and Brooks Paige and David Tolpin and Frank Wood},
journal= {arXiv preprint arXiv:1507.04635},
year = {2016}
}