无限时域非线性最优控制问题的策略迭代收敛性
最优化与控制
2025-07-15 v1 数值分析
数值分析
摘要
策略迭代 (PI) 是一种广泛用于合成最优反馈控制策略的算法,适用于众多工程和科学应用。然而,当PI部署在无限时域、非线性、自主的最优控制问题上时,出现许多重大理论挑战——特别是当计算状态空间受限于有界域时。在本文中,我们调查了这些挑战并表明,PI在此设置下的可行性取决于在每个迭代中求解的广义Hamilton-Jacobi-Bellman (GHJB) 方程解的存在性、唯一性和正则性。为了确保迭代方案的良好定义,GHJB解必须具备足够的光滑性,并且在解的域上必须在由当前策略诱导的闭环动力学下保持前向不变。尽管该方法的收敛性在根本上至关重要,但以往研究大多忽视了这些方面。本文通过引入一种构造性程序来保证整个PI序列中计算域的前向不变性,并在每个迭代中建立适当光滑性GHJB解的充分条件来弥合了这一差距。为支持理论 findings,本文提出了基于网格的PI实现的数值结果。
引用
@article{arxiv.2507.09994,
title = {On the Convergence of the Policy Iteration for Infinite-Horizon Nonlinear Optimal Control Problems},
author = {Tobias Ehring and Behzad Azmi and Bernard Haasdonk},
journal= {arXiv preprint arXiv:2507.09994},
year = {2025}
}
备注
35 pages and 3 figures