中文

机器学习反馈控制律收敛性:平均反馈学习方案与数据驱动方法

最优化与控制 2025-05-28 v3

摘要

本 work 关注通过机器学习合成最优反馈控制律。具体考虑了平均反馈学习方案 (Averaged Feedback Learning Scheme, AFLS) 和一种数据驱动方法。本文提供了确保这些方法在获得的反馈控制律处对控制问题目标函数评估值收敛至最优值函数的假设条件。这些假设与值函数的正则性及动力学稳定性相联系。在 AFLS 情况下,这些假设仅要求值函数满足 H"older 连续性,而在数据驱动方法中则要求值函数至少为 C2C^2。我们演示这些方法通过其最优性条件相互关联。此外,还通过将两种方法应用于一族参数化控制问题来提供数值实验,该参数化问题由一个正实数参数控制,后者控制值函数的正则性。在参数较小时,值函数光滑;而在参数较大时,值函数不可导,但半凹。实验结果表明,当值函数光滑时,两种方法性能相似;另一方面,如果值函数不可导,AFLS 的性能更好,这与所得收敛结果一致。

关键词

引用

@article{arxiv.2407.18403,
  title  = {Convergence of machine learning methods for feedback control laws: averaged feedback learning scheme and data driven methods},
  author = {Karl Kunisch and Donato Vásquez-Varas},
  journal= {arXiv preprint arXiv:2407.18403},
  year   = {2025}
}