中文

基于李雅普诺夫方法的分散式多智能体强化学习控制

系统与控制 2020-09-22 v1 机器学习 系统与控制

摘要

分散式多智能体控制具有广泛应用,从多机器人协作到分布式传感器网络。在分散式多智能体控制中,系统复杂且动态未知或高度不确定,传统的基于模型的控制方法难以应用。与控制理论中基于模型的控制相比,深度强化学习(DRL)有望在不了解系统动态的情况下从数据中学习控制器/策略。然而,将 DRL 直接应用于分散式多智能体控制具有挑战性,因为智能体间的交互使学习环境非平稳。更重要的是,现有的多智能体强化学习(MARL)算法无法从控制理论角度确保多智能体系统的闭环稳定性,因此学到的控制策略在实际应用中极有可能产生异常或危险行为。因此,若无稳定性保证,现有 MARL 算法在真实多智能体系统(如无人机、机器人和电力系统等)中的应用令人担忧。本文旨在提出一种具有稳定性保证的、用于分散式多智能体控制的新 MARL 算法。该新 MARL 算法称为多智能体软演员-评论家(MASAC),是在著名的“集中训练-分散执行”框架下提出的。通过在我们的 MASAC 算法策略改进过程中引入稳定性约束,保证了闭环稳定性。该稳定性约束基于控制理论中的李雅普诺夫方法设计。为证明有效性,我们给出一个多智能体导航示例来展示所提 MASAC 算法的效率。

关键词

引用

@article{arxiv.2009.09361,
  title  = {Lyapunov-Based Reinforcement Learning for Decentralized Multi-Agent Control},
  author = {Qingrui Zhang and Hao Dong and Wei Pan},
  journal= {arXiv preprint arXiv:2009.09361},
  year   = {2020}
}

备注

Accepted to The 2nd International Conference on Distributed Artificial Intelligence