部分可观测马尔可夫决策过程中最优平稳控制的几何结构与确定性
最优化与控制
2016-02-16 v2 人工智能
摘要
众所周知,对于任何有限状态马尔可夫决策过程 (MDP),都存在一个最大化期望回报的无记忆确定性策略。对于部分可观测马尔可夫决策过程 (POMDP),最优无记忆策略通常是随机的。我们研究了在无记忆随机策略集合上的期望回报优化问题。我们将此表述为一个约束线性优化问题,并开发了相应的几何框架。我们证明了任何 POMDP 都具有一个具有有限随机性的最优无记忆策略,这使我们能够降低搜索空间的维度。实验表明,该方法能在所评估的系统上实现策略梯度更好、更快的收敛。
引用
@article{arxiv.1503.07206,
title = {Geometry and Determinism of Optimal Stationary Control in Partially Observable Markov Decision Processes},
author = {Guido Montufar and Keyan Ghazi-Zahedi and Nihat Ay},
journal= {arXiv preprint arXiv:1503.07206},
year = {2016}
}
备注
25 pages, 7 figures