中文

未知线性时不变系统分布式在线LQR控制的遗憾分析

最优化与控制 2022-02-08 v2 机器学习 系统与控制 系统与控制

摘要

在线优化近年来为研究事先未知的时间变化代价函数的最优控制开辟了途径。受此研究思路启发,我们研究了具有未知动态的线性时不变(LTI)系统的分布式在线线性二次调节器(LQR)问题。考虑一个多智能体网络,其中每个智能体建模为一个LTI系统。该网络具有一个全局时间变化二次代价,其可能以对抗方式演化,并且仅由每个智能体顺序地部分观测。网络的目标是集体地(i)估计未知动态,以及(ii)计算出相对于事后最优集中式策略具有竞争力的局部控制序列,该策略最小化随时间变化的网络代价之和。该问题被表述为一个遗憾最小化问题。我们提出了一种在线LQR算法的分布式变体,其中智能体在探索阶段计算其系统估计。随后每个智能体基于其系统估计得到的可行集,在一个半定规划(SDP)上应用分布式在线梯度下降。我们证明,以高概率我们的算法遗憾界尺度为 O(T2/3logT)O(T^{2/3}\log T),意味着所有智能体随时间达成共识。我们还提供了验证我们理论保证的仿真结果。

关键词

引用

@article{arxiv.2105.07310,
  title  = {Regret Analysis of Distributed Online LQR Control for Unknown LTI Systems},
  author = {Ting-Jui Chang and Shahin Shahrampour},
  journal= {arXiv preprint arXiv:2105.07310},
  year   = {2022}
}

备注

arXiv admin note: substantial text overlap with arXiv:2009.13749