中文

部分可观测马尔可夫决策过程中有限记忆反馈策略的近最优性

最优化与控制 2022-01-11 v2 机器学习

摘要

在部分可观测马尔可夫决策过程(POMDPs)理论中,最优策略的存在性通常通过将原部分可观测随机控制问题转化为信念空间上完全可观测的问题(即信念-MDP)来确立。然而,即便原系统具有有限状态与动作空间,使用经典动态或线性规划方法为该完全可观测模型(从而原 POMDP)计算最优策略仍具挑战性,因为完全可观测信念-MDP 模型的状态空间总是不可数的。此外,严格的值函数近似与最优策略近似结果极少,所需正则条件常需对概率测度空间进行繁琐研究以得到如 Feller 连续性等性质。本文研究一类系统动态与测量信道模型已知的 POMDP 规划问题。我们仅利用有限窗口信息变量离散化信念空间,构建近似信念模型。随后为该近似模型求得最优策略,并在温和的非线性滤波器稳定性条件及测量与动作集有限(状态空间为实向量值)的假设下,严格确立所构有限窗口控制策略在 POMDP 中的近最优性。我们还建立了关联有限窗口记忆大小与近似误差界的收敛速率结果,在明确可检验的指数滤波器稳定性条件下收敛速率为指数级。尽管已有许多实验结果与少数严格渐近收敛结果,明确收敛速率结果据我们所知尚属新颖。

关键词

引用

@article{arxiv.2010.07452,
  title  = {Near Optimality of Finite Memory Feedback Policies in Partially Observed Markov Decision Processes},
  author = {Ali Devran Kara and Serdar Yuksel},
  journal= {arXiv preprint arXiv:2010.07452},
  year   = {2022}
}