分析计算在随机 LQR 问题自适应动态规划中的影响
最优化与控制
2024-02-16 v1 系统与控制
系统与控制
摘要
用于随机线性二次调节 (LQR) 的自适应动态规划 (ADP) 要求在策略迭代 (PI) 过程中精确计算随机积分。在完全无模型的问题设置中,这种计算只能通过使用规范 Euler-Maruyama 方法等计算方法,对在离散时间点收集的状态样本进行近似。我们的研究揭示了一个关键现象:采样周期会显著影响控制性能。这种影响是由于 PI 每一步引入的计算误差会显著影响算法的收敛行为,进而影响最终的控制策略。我们将 PI 与应用于 Riccati 方程的牛顿法进行类比,以阐明计算如何影响控制。在此视角下,PI 每一步的计算误差表现为牛顿法每一步中的额外误差项,其上界与计算误差成正比。此外,我们证明了使用 Euler-Maruyama 方法解决随机 LQR 问题的 ADP 收敛率为 ,其中 为采样周期。最后,一项传感器运动控制任务验证了这些理论发现。
引用
@article{arxiv.2402.09575,
title = {Analyzing the Impact of Computation in Adaptive Dynamic Programming for Stochastic LQR Problem},
author = {Wenhan Cao and Alexandre Capone and Sandra Hirche and Wei Pan},
journal= {arXiv preprint arXiv:2402.09575},
year = {2024}
}