基于 ADMM 梯度更新的联邦自然策略梯度中通信效率的改进
机器学习
2023-11-01 v1 最优化与控制
摘要
联邦强化学习(FedRL)使智能体能够协作训练全局策略而无需共享各自数据。然而,高通信开销仍是一个关键瓶颈,尤其是对于二阶的自然策略梯度(NPG)方法。为解决此问题,我们提出了 FedNPG-ADMM 框架,其利用交替方向乘子法(ADMM)高效近似全局 NPG 方向。我们从理论上证明,使用基于 ADMM 的梯度更新将每次迭代的通信复杂度从 降低到 ,其中 为模型参数数量。此外,我们表明达到 误差的平稳收敛需要 次迭代(折扣因子为 ),证明 FedNPG-ADMM 保持了与标准 FedNPG 相同的收敛速率。通过在 MuJoCo 环境中对 proposed 算法进行评估,我们证明 FedNPG-ADMM 保持了标准 FedNPG 的奖励性能,并且当其联邦智能体数量增加时其收敛速率有所提升。
引用
@article{arxiv.2310.19807,
title = {Improved Communication Efficiency in Federated Natural Policy Gradient via ADMM-based Gradient Updates},
author = {Guangchen Lan and Han Wang and James Anderson and Christopher Brinton and Vaneet Aggarwal},
journal= {arXiv preprint arXiv:2310.19807},
year = {2023}
}
备注
Accepted at the 37th Conference on Neural Information Processing Systems (NeurIPS 2023)