中文

学习凸优化控制策略

最优化与控制 2019-12-23 v1 机器学习

摘要

在各种应用中使用的许多控制策略通过求解依赖于当前状态和某些参数的凸优化问题来确定输入或动作。此类凸优化控制策略(COCP)的常见例子包括线性二次调节器(LQR)、凸模型预测控制(MPC)以及凸控制李雅普诺夫或近似动态规划(ADP)策略。这些类型的控制策略通过调整优化问题中的参数(例如 LQR 权重)来进行调优,以根据特定应用的指标获得良好性能。调优通常靠手工完成,或采用简单方法如粗略的网格搜索。在本文中,我们提出一种自动化此过程的方法,通过使用性能度量相对于参数的近似梯度来调整参数。我们的方法依赖于最近开发的能够高效评估凸优化问题解相对于其参数的导数的方法。我们在几个例子上说明了我们的方法。

关键词

引用

@article{arxiv.1912.09529,
  title  = {Learning Convex Optimization Control Policies},
  author = {Akshay Agrawal and Shane Barratt and Stephen Boyd and Bartolomeo Stellato},
  journal= {arXiv preprint arXiv:1912.09529},
  year   = {2019}
}

备注

Authors listed in alphabetical order