策略迭代:因缺乏递归可行性,并非全盘皆输
最优化与控制
2022-10-27 v1 系统与控制
系统与控制
摘要
本文研究了策略迭代(PI)的递归可行性、递归鲁棒稳定性和近优性。为此,我们考虑了输入由无折扣成本函数的PI生成的确定性非线性离散时间系统。我们首先假设PI是递归可行的,即在每次迭代中求解的优化问题均存在解。在这种情况下,我们提供了新的条件来为一般吸引子建立递归鲁棒稳定性,这意味着每次迭代生成的策略确保了相对于一般状态测度的鲁棒\KL-稳定性。然后,我们推导了PI在每次迭代中返回的(次优)值函数与最优值函数之间失配的新显式界限。此后,受一个表明PI可能无法递归可行的反例启发,我们修改了PI,使其在温和条件下能先验地保证递归可行性。我们证明了这一称为PI+的改进算法在吸引子为紧集时能保持递归鲁棒稳定性。此外,在相同假设下,PI+享有与其PI对应部分相同的近优性。因此,PI+是生成确定性离散时间非线性系统近优稳定控制的有吸引力工具。
引用
@article{arxiv.2210.14459,
title = {Policy iteration: for want of recursive feasibility, all is not lost},
author = {Mathieu Granzotto and Olivier Lindamulage De Silva and Romain Postoyan and Dragan Nesic and Zhong-Ping Jiang},
journal= {arXiv preprint arXiv:2210.14459},
year = {2022}
}
备注
Submitted for review