中文

前向与后向Bellman方程提升DEC-POMDP中EM算法的效率

机器学习 2021-05-07 v2 多智能体系统 最优化与控制

摘要

分散式部分可观测马尔可夫决策过程(DEC-POMDP)对多智能体团队的序贯决策问题进行建模。由于DEC-POMDP的规划可解释为潜变量模型的最大似然估计,因此DEC-POMDP可用EM算法求解。然而,在DEC-POMDP的EM中,前向-后向算法需计算至无限时域,损害了计算效率。本文通过将前向与后向Bellman方程引入EM,提出Bellman EM算法(BEM)和改进Bellman EM算法(MBEM)。BEM比EM更高效,因其计算前向与后向Bellman方程,而非计算至无限时域的前向-后向算法。但当问题规模较大时,BEM因需计算逆矩阵而不总比EM高效。我们在MBEM中通过无逆矩阵地计算前向与后向Bellman方程规避了这一缺陷。数值实验表明MBEM的收敛速度快于EM。

关键词

引用

@article{arxiv.2103.10752,
  title  = {Forward and Backward Bellman equations improve the efficiency of EM algorithm for DEC-POMDP},
  author = {Takehiro Tottori and Tetsuya J. Kobayashi},
  journal= {arXiv preprint arXiv:2103.10752},
  year   = {2021}
}