面向学习控制策略的策略优化理论基础
最优化与控制
2022-10-11 v1 机器学习
机器学习
摘要
基于梯度的方法已广泛应用于多种应用领域中的系统设计与优化。近来,在控制与强化学习背景下研究这些方法理论性质的兴趣重新兴起。本文综述策略优化的一些近期进展——这是一种基于梯度的迭代反馈控制综合方法,因强化学习的成功而普及。我们在阐述中采取连接控制理论、强化学习与大规模优化的跨学科视角。我们回顾针对线性二次调节器(LQR)、 控制、风险敏感控制、线性二次高斯(LQG)控制以及输出反馈综合等多种连续控制问题,基于梯度方法的优化地形、全局收敛性与样本复杂度的若干近期理论结果。结合这些优化结果,我们也讨论直接策略优化如何处理基于学习的控制中的稳定性与鲁棒性关切,此二者为控制工程的主要诉求。我们以指出学习与控制交叉处的若干挑战与机遇作结。
引用
@article{arxiv.2210.04810,
title = {Towards a Theoretical Foundation of Policy Optimization for Learning Control Policies},
author = {Bin Hu and Kaiqing Zhang and Na Li and Mehran Mesbahi and Maryam Fazel and Tamer Başar},
journal= {arXiv preprint arXiv:2210.04810},
year = {2022}
}
备注
To Appear in Annual Review of Control, Robotics, and Autonomous Systems