中文

基于精确 Q 损失及其高斯-牛顿近似的非线性 MPC 模仿学习

机器学习 2023-04-05 v1 最优化与控制

摘要

本工作提出了一种通过模仿学习(Imitation Learning)学习非线性模型预测控制(Model Predictive Control, MPC)策略的新损失函数。标准的模仿学习方法忽略有关专家的信息,通常采用基于专家与所学控制量之间距离的损失函数。在本工作中,我们提出了一种基于 Q 函数的损失,直接嵌入相关最优控制问题(Optimal Control Problem, OCP)的性能目标与约束满足。然而,用 Q 损失训练神经网络需要对每个新样本求解相关的 OCP。为减轻计算负担,我们推导了基于 OCP 高斯-牛顿(Gauss-Newton)近似的第二 Q 损失,从而加快训练时间。我们在带约束的非线性系统控制上,针对行为克隆(Behavioral Cloning,模仿学习的标准方法)验证了我们的损失。最终结果表明,基于 Q 函数的损失显著减少了约束违反量,同时实现了可比或更好的闭环代价。

关键词

引用

@article{arxiv.2304.01782,
  title  = {Imitation Learning from Nonlinear MPC via the Exact Q-Loss and its Gauss-Newton Approximation},
  author = {Andrea Ghezzi and Jasper Hoffman and Jonathan Frey and Joschka Boedecker and Moritz Diehl},
  journal= {arXiv preprint arXiv:2304.01782},
  year   = {2023}
}

备注

Submitted to Conference on Decision and Control (CDC) 2023. The paper contains 6 pages