使用深度强化学习的(隐模型)POMDP有限状态控制器
人工智能
2026-04-02 v2
摘要
求解部分可观测马尔可夫决策过程(POMDPs)需要在状态信息不完美的情况下计算策略。尽管最近取得了进展,现有POMDP求解器的可扩展性仍然有限。此外,许多场景需要一种对多个POMDPs鲁棒的策略,这进一步加剧了可扩展性问题。我们提出了用于POMDP求解的Lexpop框架。Lexpop (1) 使用深度强化学习训练一个由循环神经网络表示的神经策略,以及 (2) 通过高效的提取方法构建一个模仿神经策略的有限状态控制器。至关重要的是,与神经策略不同,这种控制器可以被形式化评估,提供性能保证。我们将Lexpop扩展到为隐模型POMDPs(HM-POMDPs)计算鲁棒策略,HM-POMDPs描述了POMDPs的有限集合。我们将每个提取的控制器与其最坏情况的POMDP相关联。使用这样一组POMDPs,我们迭代地训练一个鲁棒的神经策略,并随后提取一个鲁棒的控制器。我们的实验表明,在具有大状态空间的问题上,Lexpop在POMDPs以及HM-POMDPs上均优于最先进的求解器。
引用
@article{arxiv.2602.08734,
title = {Finite-State Controllers for (Hidden-Model) POMDPs using Deep Reinforcement Learning},
author = {David Hudák and Maris F. L. Galesloot and Martin Tappler and Martin Kurečka and Nils Jansen and Milan Češka},
journal= {arXiv preprint arXiv:2602.08734},
year = {2026}
}
备注
17 pages (8 main paper, 2 references, 7 appendix). 3 figures in the main paper, 3 figures in the appendix. Accepted AAMAS'26 submission