无限时域可微模型预测控制
最优化与控制
2020-01-09 v1 机器学习
系统与控制
系统与控制
摘要
本文提出一种用于安全模仿学习的可微线性二次模型预测控制(MPC)框架。利用由离散时间代数Riccati方程(DARE)获得的终端代价函数强制实现无限时域代价,从而可证明所学控制器在闭环中具稳定性。核心贡献之一是推导了DARE解的解析导数,由此允许使用基于微分的学习方法。另一贡献是MPC优化问题的结构:增广拉格朗日法确保MPC优化在训练全程可行,同时对状态与输入施加强约束,而预稳定控制器确保每次迭代的MPC解与导数均准确。该框架的学习能力在一组数值研究中得到展示。
引用
@article{arxiv.2001.02244,
title = {Infinite-Horizon Differentiable Model Predictive Control},
author = {Sebastian East and Marco Gallieri and Jonathan Masci and Jan Koutnik and Mark Cannon},
journal= {arXiv preprint arXiv:2001.02244},
year = {2020}
}