中文

面向一般状态与动作空间马尔可夫决策过程的原始对偶回归方法

数值分析 2022-10-05 v2 数值分析 机器学习

摘要

我们发展了一种基于回归的原始对偶鞅方法,用于求解具有一般状态与动作空间的有限时间 horizon MDP。因此,我们的方法允许构造值函数的紧致上偏与下偏近似,并提供最优策略的紧致近似。特别地,我们证明了所估计对偶间隙的紧致误差界,其对时间 horizon 呈多项式依赖,对可能无穷的状态与动作空间的基数/维数呈次线性依赖。从计算角度看,所提方法是高效的,因为与文献中通常基于对偶的最优控制问题方法不同,此处涉及的蒙特卡洛过程不需要嵌套模拟。

关键词

引用

@article{arxiv.2210.00258,
  title  = {Primal-dual regression approach for Markov decision processes with general state and action space},
  author = {Denis Belomestny and John Schoenmakers},
  journal= {arXiv preprint arXiv:2210.00258},
  year   = {2022}
}