中文

动态环境中的后悔最优控制

机器学习 2021-02-03 v2 系统与控制 系统与控制 动力系统

摘要

我们从后悔最小化的角度考虑线性时变动力系统的控制问题。与该领域大多数先前工作不同,我们关注于设计一个在线控制器,使其相对于事后所选的最优动态控制动作序列(动态后悔)最小化后悔,而非相对于某特定控制器类中的最优固定控制器(静态后悔)。当环境随时间变化且不存在单一控制器能在整个时间范围内取得良好表现时,该表述具有吸引力。我们通过一种到 HH_{\infty} 控制的新颖归约推导了后悔最优控制器的状态空间结构,并给出了其后悔关于扰动能量的紧致数据依赖界。我们的结果轻易推广到模型预测设定(控制器可预知未来扰动)以及控制器仅在固定延迟后影响系统动态的设定。我们给出了数值实验,表明我们的后悔最优控制器在随机与对抗环境中介于 H2H_2 最优与 HH_{\infty} 最优控制器的性能之间。

关键词

引用

@article{arxiv.2010.10473,
  title  = {Regret-optimal control in dynamic environments},
  author = {Gautam Goel and Babak Hassibi},
  journal= {arXiv preprint arXiv:2010.10473},
  year   = {2021}
}