中文

信息物理系统中学习与控制的分离

最优化与控制 2022-12-21 v4

摘要

大多数信息物理系统(CPS)会遇到大量数据,这些数据是实时逐渐加入系统的,而非事先全部已知。本文提供了一个理论框架,在控制理论与学习的结合点上为此类 CPS 导出最优控制策略。在所提框架中,我们使用实际的 CPS,即我们寻求在线最优控制的“真实”系统,与可用的 CPS 模型并行。随后我们为系统建立不依赖于控制策略的信息状态。这种独立性的一个重要结果是:对于任意给定的控制策略选择以及系统变量直至时刻 t 的实现,未来时刻的信息状态不依赖于时刻 t 控制策略的选择,而仅依赖于时刻 t 决策的实现,因此它们与状态估计和控制之间的分离概念相关。即,未来信息状态与当前控制策略的选择相分离。此类控制策略称为分离控制策略。因此,我们可以离线导出系统相对于信息状态的最优控制策略,该信息状态可能因模型不确定性或系统复杂性而未必精确已知,然后在数据实时逐渐加入系统时,使用标准学习方法在线学习信息状态。我们证明,在信息状态已知后,离线导出的 CPS 模型的分离控制策略对实际系统是最优的。我们在一个由两个子系统组成、具有延迟共享信息结构的动态系统中说明了所提框架。

关键词

引用

@article{arxiv.2107.06379,
  title  = {Separation of Learning and Control for Cyber-Physical Systems},
  author = {Andreas A. Malikopoulos},
  journal= {arXiv preprint arXiv:2107.06379},
  year   = {2022}
}

备注

19 pages, 2 figures. arXiv admin note: text overlap with arXiv:2101.10992