基于在线强化学习的多智能体系统分层控制
系统与控制
2020-07-29 v1 系统与控制
动力系统
摘要
我们提出一种基于强化学习的新方法,用于为具有未知状态空间模型和分离控制目标的异构线性多智能体系统设计分层线性二次调节器(LQR)控制器。该分离源于将智能体划分为多个互不重叠的组,并将控制目标定义为两个不同的目标。第一个目标旨在最小化建模组级任务的组级块分散 LQR 函数。另一方面,第二个目标试图最小化各组平均状态(质心)之间的 LQR 函数。利用这种分离,我们重新定义了 LQR 函数的加权矩阵,使其允许我们将各自的代数黎卡提方程解耦。此后,我们开发了一种强化学习策略,该策略利用智能体状态和平均状态的在线测量,基于近似黎卡提方程学习相应的控制器。由于第一个控制器是块分散的,因此可并行学习,而第二个控制器因平均化而降维,与集中式强化学习相比,整体设计显著减少了学习时间。
引用
@article{arxiv.2007.14186,
title = {Hierarchical Control of Multi-Agent Systems using Online Reinforcement Learning},
author = {He Bai and Jemin George and Aranya Chakrabortty},
journal= {arXiv preprint arXiv:2007.14186},
year = {2020}
}