Dec-POMDP中的折棍策略学习
人工智能
2015-11-24 v2 系统与控制
机器学习
摘要
期望最大化(EM)最近被证明是学习大型分散式POMDP(Dec-POMDP)中有限状态控制器(FSC)的高效算法。然而,当前方法使用固定大小的FSC,并且经常收敛到远离最优的最大值。本文考虑使用可变大小FSC来表示每个智能体的局部策略。这些可变大小FSC使用折棍先验构建,导致了一种称为“分散式折棍策略表示”(Dec-SBPR)的新框架。该方法使用变分贝叶斯算法学习控制器参数,而无需假设Dec-POMDP模型可用。Dec-SBPR的性能在几个基准问题上得到展示,表明该算法可扩展到大型问题,同时优于其他最先进的方法。
引用
@article{arxiv.1505.00274,
title = {Stick-Breaking Policy Learning in Dec-POMDPs},
author = {Miao Liu and Christopher Amato and Xuejun Liao and Lawrence Carin and Jonathan P. How},
journal= {arXiv preprint arXiv:1505.00274},
year = {2015}
}