论马尔可夫决策过程的可达性:一种基于状态分类的新型策略迭代方法
最优化与控制
2025-05-06 v2 概率论
摘要
本文关注具有有限状态与动作的离散时间受控马尔可夫系统的可靠性,旨在给出一种高效算法以获得最优(控制)策略,使系统对每个初始状态具有最大可靠性。在确立最优策略存在性后,为计算最优策略,我们引入平稳策略吸收集的概念,并给出吸收集的若干刻画与计算方法。利用最大吸收集,我们建立了一个新的最优性方程(OE),并证明该 OE 解的唯一性。进而,我们给出最优策略的策略迭代算法,并证明可在有限次迭代内获得最优策略与最大可靠性。最后,给出一个可靠性与维修问题中的例子以说明我们的结果。
引用
@article{arxiv.2308.06298,
title = {On reachability of Markov decision processes: a novel state-classification-based PI approach},
author = {Yanyun Li and Xin Guo and Xianping Guo},
journal= {arXiv preprint arXiv:2308.06298},
year = {2025}
}