中文

具有Borel空间的马尔可夫决策过程有限近似的渐近最优性

最优化与控制 2016-09-23 v3 系统与控制

摘要

众所周知,对于具有Borel状态和行为空间的马尔可夫决策过程(MDPs),计算最优策略在计算上是困难的。本文研究了具有Borel状态和行为空间的离散时间马尔可夫决策过程的有限状态近似,针对折扣代价和平均代价准则。由此获得的平稳策略被证明在相当一般的条件下(折扣代价)和更严格的条件下(平均代价)以任意精度近似最优平稳策略。对于紧状态MDPs,我们获得了明确的收敛速度界限,量化了随着近似有限状态空间大小的增加近似如何改善。利用信息论论证,对一大类问题确立了所获得收敛速度的阶最优性。我们还表明,作为预处理步骤,行为空间也可以用足够多点进行有限近似;从而,众所周知的算法,如值迭代或策略迭代、Q-learning等,可用于计算近最优策略。

关键词

引用

@article{arxiv.1503.02244,
  title  = {Asymptotic Optimality of Finite Approximations to Markov Decision Processes with Borel Spaces},
  author = {Naci Saldi and Serdar Yüksel and Tamás Linder},
  journal= {arXiv preprint arXiv:1503.02244},
  year   = {2016}
}

备注

41 pages