中文

模型设定错误的自适应线性二次控制的非渐近遗憾分析

系统与控制 2024-07-30 v3 机器学习 系统与控制

摘要

在多样化数据集上预训练大型模型,然后针对特定应用进行微调的策略,已在计算机视觉、自然语言处理和机器人控制领域取得了显著成果。该策略在自适应控制中具有巨大潜力,因为在自适应控制中需要在数据有限的情况下快速适应变化的条件。为了具体理解预训练对自适应控制的益处,我们研究了自适应线性二次控制问题,其设定为学习者拥有一组用于动力学的基矩阵的先验知识。该基存在设定错误 (misspecified),因为它无法完美表示底层数据生成过程的动力学。我们提出了一种利用该先验知识的算法,并证明了在与系统交互 TT 次后的期望遗憾上界。在 TT 较小的机制下,上界由一项主导,该项随 poly(logT)\texttt{poly}(\log T)T\sqrt{T} 缩放,具体取决于学习者可用的先验知识。当 TT 较大时,遗憾由随 δT\delta T 增长的项主导,其中 δ\delta 量化了设定错误的程度。这一线性项源于无法使用设定错误的基完美估计底层动力学,因此除非基矩阵也能在线适应,否则不可避免。然而,它仅在 TT 较大时占主导地位,此时由于估计基矩阵权重误差产生的次线性项已变得可忽略不计。我们提供了模拟实验以验证我们的分析。模拟结果还表明,来自一组相关系统的离线数据可用作预训练阶段的一部分,以估计设定错误的动力学基,进而被我们的自适应控制器使用。

关键词

引用

@article{arxiv.2401.00073,
  title  = {Nonasymptotic Regret Analysis of Adaptive Linear Quadratic Control with Model Misspecification},
  author = {Bruce D. Lee and Anders Rantzer and Nikolai Matni},
  journal= {arXiv preprint arXiv:2401.00073},
  year   = {2024}
}