未知时变动力系统的在线控制
机器学习
2022-02-17 v1 最优化与控制
机器学习
摘要
我们在非随机控制模型中研究具有未知动态的时变线性系统的在线控制。总体而言,我们证明该设定比未知时不变或已知时变动态设定在定性上更难,并以在可能获得次线性遗憾的下界时给出算法上界来补充我们的负面结果。更具体地,我们针对常见策略类研究遗憾界:扰动作用(SLS)、扰动响应(Youla)和线性反馈策略。虽然这三类策略对于线性时不变(LTI)系统基本等价,我们证明这些等价性在时变系统中失效。我们证明了一个下界:除非系统可变性的某一度量也随时长次线性缩放,否则任何算法都无法相对于前两类策略获得次线性遗憾。此外,我们表明在状态线性反馈策略上的离线规划是NP难的,暗示在线学习问题的困难性。在正面结果方面,我们给出了一种高效算法,相对于扰动响应策略类获得次线性遗憾界,直至上述系统可变性项。事实上,我们的算法享有次线性自适应遗憾界,这是比标准遗憾更严格的度量且更适用于时变系统。我们概述了对扰动作用策略和部分观测的扩展,并提出了一种针对线性状态反馈策略遗憾的不高效算法。
引用
@article{arxiv.2202.07890,
title = {Online Control of Unknown Time-Varying Dynamical Systems},
author = {Edgar Minasyan and Paula Gradu and Max Simchowitz and Elad Hazan},
journal= {arXiv preprint arXiv:2202.07890},
year = {2022}
}