局部状态信息结构下折扣代价无限 horizon 马尔可夫决策过程的最优控制
系统与控制
2020-05-12 v2 系统与控制
摘要
本文研究一类与具有局部状态信息的马尔可夫过程相关的最优控制问题。决策者仅能局部获取状态向量信息的子集,这在多智能体系统的分散式控制问题中经常遇到。在此信息结构下,部分状态向量无法被观测。我们利用基本原理,找到了一种新形式的 Bellman 方程,以刻画局部信息结构下控制问题的最优策略。动态规划解的特征在于不可观测状态分量所对应的动力学与基于可观测局部信息的局部状态反馈策略相混合。我们进一步利用线性规划方法刻画最优局部状态反馈策略。为降低最优策略的计算复杂度,我们提出一种基于虚拟信念的近似算法以求得次优策略。我们给出了次优解的性能界,并通过数值案例研究证实了结果。
引用
@article{arxiv.2005.03169,
title = {On Optimal Control of Discounted Cost Infinite-Horizon Markov Decision Processes Under Local State Information Structures},
author = {Guanze Peng and Veeraruna Kavitha and Qunayan Zhu},
journal= {arXiv preprint arXiv:2005.03169},
year = {2020}
}