中文

模型预测控制中预测时域的强化学习

系统与控制 2021-02-23 v1 机器学习 系统与控制

摘要

模型预测控制(MPC)是一种强大的轨迹优化控制技术,能够在遵守系统约束并确保安全操作的同时控制复杂的非线性系统。MPC的能力是以较高的在线计算复杂度、需要精确的系统动力学模型以及必须针对特定控制应用调整其参数为代价的。影响计算复杂度的主要可调参数是预测时域长度,它控制MPC预测系统响应的未来远近,从而评估其所计算轨迹的最优性。较长的时域通常会提高控制性能,但需要越来越强大的计算平台,从而排除了某些控制应用。对预测时域长度的性能敏感性在状态空间上各不相同,这催生了自适应时域模型预测控制(AHMPC),其根据某些准则调整预测时域。在本文中,我们提出使用强化学习(RL)将最优预测时域学习为状态的函数。我们展示了RL学习问题如何表述,并在两个控制任务上测试了我们的方法,显示出相对于固定时域MPC方案的明显改进,同时仅需数分钟的学习时间。

关键词

引用

@article{arxiv.2102.11122,
  title  = {Reinforcement Learning of the Prediction Horizon in Model Predictive Control},
  author = {Eivind Bøhn and Sebastien Gros and Signe Moe and Tor Arne Johansen},
  journal= {arXiv preprint arXiv:2102.11122},
  year   = {2021}
}

备注

This work has been submitted to IFAC NMPC 2021 for possible publication