中文

FedKL:通过惩罚 KL 散度解决联邦强化学习中的数据异构性

机器学习 2024-05-24 v3

摘要

作为一种分布式学习范式,联邦学习(FL)因多轮模型同步与聚合而面临通信瓶颈问题。异构数据通过导致缓慢收敛进一步恶化了该状况。尽管数据异构性对监督式 FL 的影响已被广泛研究,针对联邦强化学习(FRL)的相关研究仍处于起步阶段。本文中,我们首先定义了基于策略梯度的 FRL 系统中数据异构性的类型与程度。通过考察全局与局部目标函数之间的联系,我们证明若以局部与全局策略之间的总变差(TV)距离对局部更新适当惩罚,局部训练可有益于全局目标。我们还推导出了全局策略可从局部策略学习的必要条件,其直接关联于异构性程度。基于该理论结果,提出了一种基于 Kullback-Leibler(KL)散度的惩罚项,与在参数空间惩罚模型散度的常规方法不同,该方法直接在分布空间约束模型输出。本文亦给出了所提算法的收敛性证明。通过以全局惩罚联合惩罚局部策略偏离全局策略的程度,并以局部惩罚约束局部训练的每次迭代,所提方法在训练速度(步长)与收敛性之间实现了更好的权衡。在两个流行的强化学习(RL)实验平台上的实验结果证明了该算法在异构数据下加速与稳定训练过程方面优于现有方法。

关键词

引用

@article{arxiv.2204.08125,
  title  = {FedKL: Tackling Data Heterogeneity in Federated Reinforcement Learning by Penalizing KL Divergence},
  author = {Zhijie Xie and S. H. Song},
  journal= {arXiv preprint arXiv:2204.08125},
  year   = {2024}
}