中文

具有指数效用的连续时间马尔可夫决策过程

最优化与控制 2016-11-29 v2

摘要

本文考虑Borel空间中的连续时间马尔可夫决策过程(CTMDP),其中需要最小化关于总未折现成本的指数效用的确定性等价。成本率是非负的。我们建立了最优方程。在紧致-连续性条件下,我们证明了确定性平稳最优策略的存在性。我们将风险敏感的CTMDP问题归约为一个等价的风险敏感离散时间马尔可夫决策过程,该过程与原CTMDP具有相同的状态和动作空间。特别地,CTMDP问题的值迭代算法源于此归约。我们无需对状态中转移率和成本率的增长施加任何条件,且受控过程可以是爆炸性的。

关键词

引用

@article{arxiv.1610.02844,
  title  = {Continuous-time Markov decision processes with exponential utility},
  author = {Yi Zhang},
  journal= {arXiv preprint arXiv:1610.02844},
  year   = {2016}
}