中文

线性动力系统的黑盒控制

机器学习 2021-02-19 v3 机器学习

摘要

我们考虑从单一黑盒交互链控制未知线性时不变动力系统的问题,无法访问重置或离线仿真。在系统可控的假设下,我们给出首个高效算法,能在在线非随机控制设定下于单条轨迹中获得次线性后悔。这解决了随机 LQR 问题的一个开放问题,且处于更具挑战性的设定中——允许对抗扰动及对抗选定且变化的凸损失函数。我们对算法给出有限时间后悔界:一般非随机控制为 2O~(L)+O~(poly(L)T2/3)2^{\tilde{O}(\mathcal{L})} + \tilde{O}(\text{poly}(\mathcal{L}) T^{2/3}),黑盒 LQR 为 2O~(L)+O~(poly(L)T)2^{\tilde{O}(\mathcal{L})} + \tilde{O}(\text{poly}(\mathcal{L}) \sqrt{T}),其中 L\mathcal{L} 为系统规模,是维数的上界。关键步骤是一种对对抗噪声鲁棒但带来指数代价的新系统辨识方法。为补全图景,我们探究了在线黑盒控制问题的复杂度,并给出后悔下界 2Ω(L)2^{\Omega(\mathcal{L})},表明额外的指数代价不可避免。该下界即便在无噪声设定下也成立,且适用于任何随机或确定性黑盒控制方法。

关键词

引用

@article{arxiv.2007.06650,
  title  = {Black-Box Control for Linear Dynamical Systems},
  author = {Xinyi Chen and Elad Hazan},
  journal= {arXiv preprint arXiv:2007.06650},
  year   = {2021}
}