中文

基于 ADMM 梯度更新的联邦自然策略梯度中通信效率的改进

机器学习 2023-11-01 v1 最优化与控制

摘要

联邦强化学习(FedRL)使智能体能够协作训练全局策略而无需共享各自数据。然而,高通信开销仍是一个关键瓶颈,尤其是对于二阶的自然策略梯度(NPG)方法。为解决此问题,我们提出了 FedNPG-ADMM 框架,其利用交替方向乘子法(ADMM)高效近似全局 NPG 方向。我们从理论上证明,使用基于 ADMM 的梯度更新将每次迭代的通信复杂度从 O(d2){O}({d^{2}}) 降低到 O(d){O}({d}),其中 dd 为模型参数数量。此外,我们表明达到 ϵ\epsilon 误差的平稳收敛需要 O(1(1γ)2ϵ){O}(\frac{1}{(1-\gamma)^{2}{\epsilon}}) 次迭代(折扣因子为 γ\gamma),证明 FedNPG-ADMM 保持了与标准 FedNPG 相同的收敛速率。通过在 MuJoCo 环境中对 proposed 算法进行评估,我们证明 FedNPG-ADMM 保持了标准 FedNPG 的奖励性能,并且当其联邦智能体数量增加时其收敛速率有所提升。

关键词

引用

@article{arxiv.2310.19807,
  title  = {Improved Communication Efficiency in Federated Natural Policy Gradient via ADMM-based Gradient Updates},
  author = {Guangchen Lan and Han Wang and James Anderson and Christopher Brinton and Vaneet Aggarwal},
  journal= {arXiv preprint arXiv:2310.19807},
  year   = {2023}
}

备注

Accepted at the 37th Conference on Neural Information Processing Systems (NeurIPS 2023)