中文

利用监督学习构建短视MPC策略

机器学习 2026-03-27 v3 系统与控制 系统与控制 最优化与控制

摘要

监督学习技术与模型预测控制(MPC)的结合应用最近引起了极大兴趣,特别是在近似显式MPC领域,其中使用深度神经网络等函数逼近器通过离线生成的最优状态-动作对来学习MPC策略。虽然近似显式MPC的目标是紧密复现MPC策略,用训练好的神经网络替代在线优化,但求解在线优化问题所带来的性能保证通常会丢失。本文考虑了一种替代策略,即使用监督学习离线学习最优值函数,而不是学习最优策略。然后,可以将其用作预测时域非常短的短视MPC中的代价函数,从而在不影响控制器性能的情况下显著降低在线计算负担。这种方法与现有的值函数近似工作不同,它通过使用离线收集的状态-值对来学习代价函数,而不是使用闭环性能数据。使用基于灵敏度的数据增强方案解决了生成用于训练的状态-值对的成本问题。

关键词

引用

@article{arxiv.2401.12546,
  title  = {On Building Myopic MPC Policies using Supervised Learning},
  author = {Christopher A. Orrico and Bokan Yang and Dinesh Krishnamoorthy},
  journal= {arXiv preprint arXiv:2401.12546},
  year   = {2026}
}

备注

Updated version available as arXiv:2508.05804