作为概率正则语言生成器的无限时域部分可观测决策过程的最优控制
最优化与控制
2009-08-07 v2
摘要
具有不完全状态反馈的决策过程传统上被建模为部分可观测马尔可夫决策过程。在本文中,我们提出了一种基于概率正则语言的替代公式。所提出的方法推广了最近报道的关于完全可观测情况下基于语言测度论的最优控制工作,并表明该框架在计算上比经典替代方案更易处理。特别是,我们表明,在所提出的框架中建模的部分观测下的无限时域决策问题是-可逼近的,并且通常解决起来并不比完全可观测情况更困难。该方法通过两个简单示例加以说明。
引用
@article{arxiv.0907.2738,
title = {Optimal Control of Infinite Horizon Partially Observable Decision Processes Modeled As Generators of Probabilistic Regular Languages},
author = {Ishanu Chattopadhyay and Asok Ray},
journal= {arXiv preprint arXiv:0907.2738},
year = {2009}
}
备注
23 pages 13 figures: This is an abridged/summarized version with explicit proofs either sketched or skipped. The full expanded version is submitted for publication in the International Journal of Control (Taylor and Francis)