基于精确 Q 损失及其高斯-牛顿近似的非线性 MPC 模仿学习
机器学习
2023-04-05 v1 最优化与控制
摘要
本工作提出了一种通过模仿学习(Imitation Learning)学习非线性模型预测控制(Model Predictive Control, MPC)策略的新损失函数。标准的模仿学习方法忽略有关专家的信息,通常采用基于专家与所学控制量之间距离的损失函数。在本工作中,我们提出了一种基于 Q 函数的损失,直接嵌入相关最优控制问题(Optimal Control Problem, OCP)的性能目标与约束满足。然而,用 Q 损失训练神经网络需要对每个新样本求解相关的 OCP。为减轻计算负担,我们推导了基于 OCP 高斯-牛顿(Gauss-Newton)近似的第二 Q 损失,从而加快训练时间。我们在带约束的非线性系统控制上,针对行为克隆(Behavioral Cloning,模仿学习的标准方法)验证了我们的损失。最终结果表明,基于 Q 函数的损失显著减少了约束违反量,同时实现了可比或更好的闭环代价。
引用
@article{arxiv.2304.01782,
title = {Imitation Learning from Nonlinear MPC via the Exact Q-Loss and its Gauss-Newton Approximation},
author = {Andrea Ghezzi and Jasper Hoffman and Jonathan Frey and Joschka Boedecker and Moritz Diehl},
journal= {arXiv preprint arXiv:2304.01782},
year = {2023}
}
备注
Submitted to Conference on Decision and Control (CDC) 2023. The paper contains 6 pages