中文

基于策略梯度更新的异步联邦强化学习:算法设计与收敛性分析

机器学习 2025-01-27 v5 分布式、并行与集群计算 网络与互联网体系结构

摘要

为了提高强化学习(RL)的效率,我们提出了一种新颖的异步联邦强化学习(FedRL)框架,称为 AFedPG,该框架通过 NN 个智能体之间的协作并使用策略梯度(PG)更新来构建全局模型。为了解决异步设置中策略滞后带来的挑战,我们设计了一种专门针对 FedRL 的延迟自适应前瞻技术,能够有效处理策略梯度异构到达时间的问题。我们分析了 AFedPG 的理论全局收敛界限,并从样本复杂度和时间复杂度两方面刻画了所提出算法的优势。具体而言,我们的 AFedPG 方法在每个智能体上平均实现了 O(ϵ2.5N)O(\frac{{\epsilon}^{-2.5}}{N}) 的全局收敛样本复杂度。与样本复杂度为 O(ϵ2.5)O(\epsilon^{-2.5}) 的单智能体设置相比,它享有相对于智能体数量的线性加速。此外,与同步 FedPG 相比,AFedPG 将时间复杂度从 O(tmaxN)O(\frac{t_{\max}}{N}) 改进为 O(i=1N1ti)1O({\sum_{i=1}^{N} \frac{1}{t_{i}}})^{-1},其中 tit_{i} 表示智能体 ii 每次迭代的时间消耗,tmaxt_{\max} 为其中的最大值。后者的复杂度 O(i=1N1ti)1O({\sum_{i=1}^{N} \frac{1}{t_{i}}})^{-1} 始终小于前者,并且这种改进在具有异构计算能力(tmaxtmint_{\max}\gg t_{\min})的大规模联邦设置中变得尤为显著。最后,我们在四个广泛使用的 MuJoCo 环境中通过改变智能体数量,实证验证了 AFedPG 的性能提升。我们还展示了 AFedPG 在各种计算异构性场景下的优势。

关键词

引用

@article{arxiv.2404.08003,
  title  = {Asynchronous Federated Reinforcement Learning with Policy Gradient Updates: Algorithm Design and Convergence Analysis},
  author = {Guangchen Lan and Dong-Jun Han and Abolfazl Hashemi and Vaneet Aggarwal and Christopher G. Brinton},
  journal= {arXiv preprint arXiv:2404.08003},
  year   = {2025}
}

备注

Published as a conference paper at ICLR 2025