中文

用于马尔可夫过程最优控制的回归-后蒙特卡洛方法

最优化与控制 2017-12-29 v1

摘要

我们开发了两种回归蒙特卡洛算法(值迭代与性能迭代)来求解离散时间马尔可夫过程最优随机控制的一般问题。我们在一个创新框架内表述方法,从而能证明数值格式的收敛速度。我们依赖于回归-后(Regress Later)途径,不同于其他采用回归-现(Regress Now)技术的尝试。我们利用证明中得到的误差界与数值实验,考察值迭代与性能迭代途径之间的差异。它们分别由Tsitsiklis和VanRoy [2001]以及Longstaff和Schwartz [2001]引入,其特征在文献中大体未被注意;然而我们表明,这些差异在随机控制问题的实际求解中至关重要。最后,我们给出了算法调参的一些准则。

关键词

引用

@article{arxiv.1712.09705,
  title  = {Regress-Later Monte Carlo for optimal control of Markov processes},
  author = {Alessandro Balata and Jan Palczewski},
  journal= {arXiv preprint arXiv:1712.09705},
  year   = {2017}
}

备注

31 pages