具有有限时域期望总成本准则的连续时间马尔可夫决策过程
最优化与控制
2014-08-26 v1
摘要
本文研究了在有限时域期望总成本准则下,连续时间马尔可夫决策过程的无约束和约束情形。状态空间是可数的,转移率和成本率允许上下无界。我们给出了在所有随机历史依赖策略类中存在最优策略的条件。对于无约束情形,利用条件期望形式的前向 Kolmogorov 方程的类比,我们证明了有限时域最优值函数是最优方程的唯一解,并获得了一个最优确定性马尔可夫策略的存在性。对于约束情形,采用占位测度技术,我们首先给出了占位测度的等价刻画,并推导出对于由随机历史依赖策略生成的每个占位测度,都存在一个由随机马尔可夫策略生成的与之相等的占位测度。然后,利用所有占位测度集合的紧性和凸性,我们获得了约束最优随机马尔可夫策略的存在性。此外,该约束优化问题被重构为一个线性规划问题,并建立了该线性规划及其对偶规划之间的强对偶性。最后,用一个受控的生灭系统来说明我们的主要结果。
引用
@article{arxiv.1408.5497,
title = {Continuous-time Markov Decision Processes with Finite-horizon Expected Total Cost Criteria},
author = {Qingda Wei and Xian Chen},
journal= {arXiv preprint arXiv:1408.5497},
year = {2014}
}