基于策略梯度更新的异步联邦强化学习:算法设计与收敛性分析
机器学习
2025-01-27 v5 分布式、并行与集群计算
网络与互联网体系结构
摘要
为了提高强化学习(RL)的效率,我们提出了一种新颖的异步联邦强化学习(FedRL)框架,称为 AFedPG,该框架通过 个智能体之间的协作并使用策略梯度(PG)更新来构建全局模型。为了解决异步设置中策略滞后带来的挑战,我们设计了一种专门针对 FedRL 的延迟自适应前瞻技术,能够有效处理策略梯度异构到达时间的问题。我们分析了 AFedPG 的理论全局收敛界限,并从样本复杂度和时间复杂度两方面刻画了所提出算法的优势。具体而言,我们的 AFedPG 方法在每个智能体上平均实现了 的全局收敛样本复杂度。与样本复杂度为 的单智能体设置相比,它享有相对于智能体数量的线性加速。此外,与同步 FedPG 相比,AFedPG 将时间复杂度从 改进为 ,其中 表示智能体 每次迭代的时间消耗, 为其中的最大值。后者的复杂度 始终小于前者,并且这种改进在具有异构计算能力()的大规模联邦设置中变得尤为显著。最后,我们在四个广泛使用的 MuJoCo 环境中通过改变智能体数量,实证验证了 AFedPG 的性能提升。我们还展示了 AFedPG 在各种计算异构性场景下的优势。
引用
@article{arxiv.2404.08003,
title = {Asynchronous Federated Reinforcement Learning with Policy Gradient Updates: Algorithm Design and Convergence Analysis},
author = {Guangchen Lan and Dong-Jun Han and Abolfazl Hashemi and Vaneet Aggarwal and Christopher G. Brinton},
journal= {arXiv preprint arXiv:2404.08003},
year = {2025}
}
备注
Published as a conference paper at ICLR 2025