中文

基于模型的学习:在POMDP中实现近最优的有限时窗策略

机器学习 2026-04-02 v1

摘要

我们研究了在表格化部分可观测马尔可夫决策过程(POMDP)中学习有限时窗策略的模型方法。部分可观测性下的学习常用的方法是通过有限动作-观察窗口来近似不可限时的历史依赖关系。这会在历史上引入一个有限状态马尔可夫决策过程(MDP),称为“超状态MDP”。一旦获得该超状态MDP的模型,就可以使用标准MDP算法来计算最优策略,这就促使需要样本高效的模型估计。估计超状态MDP模型具有挑战性,因为轨迹是通过与原始POMDP交互来生成的,这导致抽样过程与目标模型之间存在不匹配。我们提出了一种针对表格化POMDP的模型估计程序,并分析了其样本复杂度。我们的分析利用了滤波稳定性与弱依赖随机变量的浓度不等式之间的联系。因此,我们获得了从单个轨迹估计超状态MDP模型的紧密样本复杂度保证。结合价值迭代,该方法可为POMDP实现近似最优的有限时窗策略。

关键词

引用

@article{arxiv.2604.01024,
  title  = {Model-Based Learning of Near-Optimal Finite-Window Policies in POMDPs},
  author = {Philip Jordan and Maryam Kamgarpour},
  journal= {arXiv preprint arXiv:2604.01024},
  year   = {2026}
}