中文

使用深度强化学习的(隐模型)POMDP有限状态控制器

人工智能 2026-04-02 v2

摘要

求解部分可观测马尔可夫决策过程(POMDPs)需要在状态信息不完美的情况下计算策略。尽管最近取得了进展,现有POMDP求解器的可扩展性仍然有限。此外,许多场景需要一种对多个POMDPs鲁棒的策略,这进一步加剧了可扩展性问题。我们提出了用于POMDP求解的Lexpop框架。Lexpop (1) 使用深度强化学习训练一个由循环神经网络表示的神经策略,以及 (2) 通过高效的提取方法构建一个模仿神经策略的有限状态控制器。至关重要的是,与神经策略不同,这种控制器可以被形式化评估,提供性能保证。我们将Lexpop扩展到为隐模型POMDPs(HM-POMDPs)计算鲁棒策略,HM-POMDPs描述了POMDPs的有限集合。我们将每个提取的控制器与其最坏情况的POMDP相关联。使用这样一组POMDPs,我们迭代地训练一个鲁棒的神经策略,并随后提取一个鲁棒的控制器。我们的实验表明,在具有大状态空间的问题上,Lexpop在POMDPs以及HM-POMDPs上均优于最先进的求解器。

关键词

引用

@article{arxiv.2602.08734,
  title  = {Finite-State Controllers for (Hidden-Model) POMDPs using Deep Reinforcement Learning},
  author = {David Hudák and Maris F. L. Galesloot and Martin Tappler and Martin Kurečka and Nils Jansen and Milan Češka},
  journal= {arXiv preprint arXiv:2602.08734},
  year   = {2026}
}

备注

17 pages (8 main paper, 2 references, 7 appendix). 3 figures in the main paper, 3 figures in the appendix. Accepted AAMAS'26 submission