用于POMDP的稀疏随机有限状态控制器
人工智能
2012-06-18 v1
摘要
有界策略迭代是一种求解无限时域POMDP的方法,它将策略表示为随机有限状态控制器,并通过线性规划调整每个节点的参数来迭代改进控制器。在原始算法中,线性规划的大小(从而策略改进的复杂度)取决于每个节点的参数数量,该数量随控制器规模增长。但在实践中,非零值的节点参数数量通常非常小,且不随控制器规模增长。基于这一观察,我们开发了一种有界策略迭代的变体,它利用了随机有限状态控制器的稀疏结构。在每次迭代中,它改进策略的程度与原始算法相同,但具有更好的可扩展性。
引用
@article{arxiv.1206.3263,
title = {Sparse Stochastic Finite-State Controllers for POMDPs},
author = {Eric A. Hansen},
journal= {arXiv preprint arXiv:1206.3263},
year = {2012}
}
备注
Appears in Proceedings of the Twenty-Fourth Conference on Uncertainty in Artificial Intelligence (UAI2008)