中文

高效通信下联邦多智能体强化学习的梯度收敛界

机器学习 2023-05-30 v2 人工智能 多智能体系统

摘要

本文在联邦学习(FL)范式下研究面向多智能体协作决策的独立强化学习(IRL)。然而,FL在智能体与远程中心服务器之间产生过高的通信开销,尤其在涉及大量智能体或迭代时更为显著。此外,由于独立学习环境的异构性,多个智能体可能经历异步马尔可夫决策过程(MDPs),这将影响训练样本及模型的收敛性能。在变分感知周期平均(VPA)方法与基于策略的深度强化学习(DRL)算法(即近端策略优化(PPO))的基础上,本文提出两种面向随机梯度下降(SGD)的进阶优化方案:1)基于衰减的方案随着连续本地更新的推进逐步衰减模型本地梯度的权重;2)通过将智能体表示为图,基于一致性的方案从代数连通性视角研究邻近智能体间交换模型本地梯度的影响。本文还为所提两种方案提供了新颖的收敛保证,并通过理论分析与仿真结果证明了它们在提升系统效用值方面的优越有效性与效率。

关键词

引用

@article{arxiv.2103.13026,
  title  = {The Gradient Convergence Bound of Federated Multi-Agent Reinforcement Learning with Efficient Communication},
  author = {Xing Xu and Rongpeng Li and Zhifeng Zhao and Honggang Zhang},
  journal= {arXiv preprint arXiv:2103.13026},
  year   = {2023}
}