具有普遍可测策略的 Borel 空间马尔可夫决策过程的平均代价最优性结果
最优化与控制
2021-04-02 v1
摘要
我们考虑具有 Borel 状态与动作空间以及普遍可测策略的离散时间马尔可夫决策过程。针对若干长期平均代价准则,我们确立了如下最优性结果:最优平均代价函数为下半解析的,存在普遍可测的半马尔可夫或历史依赖 -最优策略,并且类似结果对由马尔可夫或平稳策略可实现的最小平均代价也成立。随后我们分析了最优平均代价函数的结构,证明了它们关于某些 -有限测度几乎处处为常数的充分条件。此处最重要的条件是:每个具有正测度的状态子集在某一策略下能以概率一到达。我们通过利用最优平均代价函数的一个不等式及其与下鞅的联系得到上述结果,并在涉及平稳策略的特殊情形中借助常返马尔可夫链理论予以证明。
引用
@article{arxiv.2104.00181,
title = {Average-Cost Optimality Results for Borel-Space Markov Decision Processes with Universally Measurable Policies},
author = {Huizhen Yu},
journal= {arXiv preprint arXiv:2104.00181},
year = {2021}
}
备注
36 pages