中文

具有交互与通信效率的基于动量的联邦强化学习

机器学习 2024-05-30 v2 人工智能

摘要

联邦强化学习(FRL)近期受到越来越多的关注。然而,由于数据分布固有的时空非平稳性,当前的方法通常面临高昂的交互和通信成本。在本文中,我们引入了一种名为 MFPO\texttt{MFPO} 的新 FRL 算法,该算法利用动量、重要性采样和额外的服务器端调整来控制随机策略梯度的偏移并提高数据利用效率。我们证明,通过适当选择动量参数和交互频率,MFPO\texttt{MFPO} 可以实现 O~(HN1ϵ3/2)\tilde{\mathcal{O}}(H N^{-1}\epsilon^{-3/2})O~(ϵ1)\tilde{\mathcal{O}}(\epsilon^{-1}) 的交互和通信复杂度(NN 表示智能体数量),其中交互复杂度实现了随智能体数量的线性加速,通信复杂度与现有的一阶联邦学习算法可达到的最佳水平相当。大量实验证实了 MFPO\texttt{MFPO} 在一系列复杂且高维的基准测试上相较于现有方法具有显著的性能提升。

关键词

引用

@article{arxiv.2405.17471,
  title  = {Momentum-Based Federated Reinforcement Learning with Interaction and Communication Efficiency},
  author = {Sheng Yue and Xingyuan Hua and Lili Chen and Ju Ren},
  journal= {arXiv preprint arXiv:2405.17471},
  year   = {2024}
}

备注

IEEE International Conference on Computer Communications (INFOCOM)