无限 horizon 马尔可夫决策过程的快速近似动态规划
最优化与控制
2022-03-18 v4 系统与控制
系统与控制
摘要
在本研究中,我们考虑具有可分离代价以及状态和输入变量约束的随机非线性系统的无限 horizon、折扣代价最优控制。利用线性时间 Legendre 变换,我们提出了一种在共轭域中实现相应值迭代 (VI) 算法的新型数值方案。提供了对所提算法的收敛性、时间复杂度和误差的详细分析。特别地,对于状态和输入空间分别采用大小为 和 的离散化,所提方法通过将原域中的最小化操作替换为共轭域中的简单加法,将 VI 算法每次迭代的时间复杂度从 降低到 。
引用
@article{arxiv.2102.08880,
title = {Fast Approximate Dynamic Programming for Infinite-Horizon Markov Decision Processes},
author = {M. A. S. Kolarijani and G. F. Max and P. Mohajerin Esfahani},
journal= {arXiv preprint arXiv:2102.08880},
year = {2022}
}