非光滑$H_\infty$输出反馈控制直接策略搜索的全局最优性研究
最优化与控制
2023-04-04 v1
摘要
直接策略搜索在强化学习中已取得巨大的经验性成功。近来,研究其在连续控制中理论性质的兴趣日益增长,针对光滑非凸的线性二次调节器(LQR)与线性二次高斯(LQG)控制已建立丰硕成果。本文考虑输出反馈系统的标准鲁棒控制,并研究直接策略搜索的全局最优性。与LQR或LQG不同,代价函数在策略空间中是非光滑的。尽管缺乏光滑性与凸性,我们的主要结果表明:对于一类非退化稳定控制器,鲁棒控制的所有Clarke驻点均为全局最优,且不存在伪局部极小。我们的证明技术受可微凸提升(DCL)思想启发,并将DCL推广至通过凸重构分析非光滑非凸的鲁棒控制。我们的结果为分析直接策略搜索求解非光滑非凸鲁棒控制问题提供了一些启示。
引用
@article{arxiv.2304.00753,
title = {On the Global Optimality of Direct Policy Search for Nonsmooth $H_\infty$ Output-Feedback Control},
author = {Yujie Tang and Yang Zheng},
journal= {arXiv preprint arXiv:2304.00753},
year = {2023}
}