中文

谨慎贝叶斯 MPC:后悔分析与非安全学习轮数界限

系统与控制 2022-09-22 v3 系统与控制

摘要

本文研究模型预测控制(MPC)概念与后验采样技术的结合,并提出一种简单的约束收紧技术,以在探索性学习阶段引入谨慎性。所给出的关于累积后悔的理论分析聚焦于已述‘谨慎贝叶斯 MPC’算法充分条件,并证明了在线性 MPC 问题下未来奖励函数的 Lipschitz 连续性。在非线性 MPC 问题下,表明非线性 MPC 优化技术通常所需的假设为基于后验采样的模型基 RL 提供了充分准则。此外,利用软约束 MPC 形式,证明了所提约束收紧在线性与非线性情形下均隐含了对期望非安全学习轮数的界限。方法的效率通过数值算例加以说明。

关键词

引用

@article{arxiv.2006.03483,
  title  = {Cautious Bayesian MPC: Regret Analysis and Bounds on the Number of Unsafe Learning Episodes},
  author = {Kim P. Wabersich and Melanie N. Zeilinger},
  journal= {arXiv preprint arXiv:2006.03483},
  year   = {2022}
}