中文

连续空间 POMDP 的近最优逼近与有限记忆策略

最优化与控制 2025-01-20 v2 系统与控制 系统与控制

摘要

我们研究了用于连续空间部分观察马尔可夫决策过程 (POMDP) 的逼近方法。贝尔思 MDP 简化方法作为研究 POMDP 的标准方法,由于状态空间被提升到概率测度的空间,因此需要严格的逼近方法才能应用于实际场景。本文在最近研究基础上,提出通过离散化观测空间并构建基于离散观测与控制动作的有限长度历史的全知有限 MDP 模型,来实现严格的逼近方法。我们证明在信道具有某些规则性假设以及隐藏状态过程满足特定受控滤波稳定性要求的情况下,所得策略是近最优的。此外,通过对测量值进行量化,我们能够利用更精细的滤波稳定条件。我们还提供了一个使用离散化信息变量有限记忆的 Q 学习算法,并证明其收敛于所用逼近方法构建的有限全知 MDP 的最优方程。

关键词

引用

@article{arxiv.2410.02895,
  title  = {Near Optimal Approximations and Finite Memory Policies for POMPDs with Continuous Spaces},
  author = {Ali Devran Kara and Erhan Bayraktar and Serdar Yuksel},
  journal= {arXiv preprint arXiv:2410.02895},
  year   = {2025}
}