连续时间跳跃马尔可夫决策过程中马尔可夫策略的充分性
最优化与控制
2020-05-18 v3
摘要
本文将马尔可夫决策过程的经典结果推广到连续时间跳跃马尔可夫决策过程(CTJMDP):该经典结果指出,对于给定的初始状态分布,对每个策略都存在一个(随机化)马尔可夫策略,其可以自然方式定义,使得在每一时刻这两个策略的状态-动作对的边缘分布一致。本文证明,当相应马尔可夫策略定义一个非爆炸性跳跃马尔可夫过程时,该等式在CTJMDP中成立。若该马尔可夫过程是爆炸性的,则在每一时刻,所述马尔可夫策略的状态-动作对属于某可测状态-动作对集合的边缘概率,不大于原策略的同一概率。本文利用这些结果证明:对于折扣总期望成本和单位时间平均成本,在给定的初始状态分布下,CTJMDP的每个策略所对应的上述马尔可夫策略具有相同或更好的性能。
引用
@article{arxiv.2003.01342,
title = {Sufficiency of Markov Policies for Continuous-Time Jump Markov Decision Processes},
author = {Eugene A. Feinberg and Manasa Mandava and Albert N. Shiryaev},
journal= {arXiv preprint arXiv:2003.01342},
year = {2020}
}