同构分布式系统的数据驱动结构化策略迭代
系统与控制
2023-11-17 v2 多智能体系统
系统与控制
最优化与控制
摘要
由交互智能体组成的网络系统的控制通常通过对底层交互建模来实现。然而,在应用中构建此类交互的精确模型可能变得难以承受。数据驱动控制方法通过直接从观测数据综合控制器来避免此类复杂性。在本文中,我们提出一种称为数据驱动结构化策略迭代 (D2SPI) 的算法,用于综合一种高效的反馈机制,该机制尊重由底层交互网络诱导的稀疏模式。特别地,我们的算法使用临时的“辅助”通信链路,以便在“学习阶段”于(更小的)子网络上实现所需的信息交换——这些链路随后将在最终分布式反馈综合中被移除。接着我们证明,学习到的策略为整个网络产生了一个稳定的结构化策略。随后我们的分析展示了所提出的分布式策略在整个学习阶段的稳定性和收敛性,利用了称为“Patterned monoid(模式幺半群)”的构造。D2SPI 的性能随后通过代表性仿真场景进行了演示。
引用
@article{arxiv.2103.11572,
title = {Data-Driven Structured Policy Iteration for Homogeneous Distributed Systems},
author = {Siavash Alemzadeh and Shahriar Talebi and Mehran Mesbahi},
journal= {arXiv preprint arXiv:2103.11572},
year = {2023}
}
备注
S. Alemzadeh and S. Talebi contributed equally to this work