一类总成本马尔可夫决策过程值迭代的收敛性
最优化与控制
2015-10-22 v2
摘要
我们考虑一类一般的总成本马尔可夫决策过程(MDP),其中单阶段成本可具有任意符号,但对于所有策略和所有初始状态,单阶段成本负部之和是有限的。我们将此类称为广义收敛(简称 GC)总成本模型,并在具有通用可测策略的 Borel MDP 框架下研究 GC 模型值迭代的收敛性。我们的主要结果包括:(i) 当从最优成本函数上方的某些函数开始时,值迭代的收敛性;(ii) 在最优成本函数非负的特殊情况下,从零开始的超穷值迭代的收敛性;以及 (iii) 对于一部分初始状态,从零开始的值迭代的部分收敛性。这些结果扩展了此前关于正成本问题或 GC 总成本问题值迭代收敛性的若干已知结果。特别是,关于从上方开始值迭代收敛性的第一个结果扩展了 van der Wal 针对 GC 模型的定理。第二个结果涉及 Maitra 和 Sudderth 对正成本模型超穷值迭代的分析。它表明当最优成本函数非负时,两种总成本模型之间存在联系,并导出了关于适当定义的动态规划算子下有限状态或有限控制 GC 问题的普通非超穷值迭代收敛性的附加结果。关于值迭代部分收敛性的第三个结果受 Whittle 针对正成本模型的桥接条件启发,并将桥接条件新颖地扩展至成本无符号约束的 GC 模型。
引用
@article{arxiv.1411.1459,
title = {On Convergence of Value Iteration for a Class of Total Cost Markov Decision Processes},
author = {Huizhen Yu},
journal= {arXiv preprint arXiv:1411.1459},
year = {2015}
}
备注
Revised report with corrections; 38 pages