中文

用于联邦学习的梯度核心集

机器学习 2024-01-17 v1

摘要

联邦学习(FL)用于在数据分布于多个客户端(包括资源受限的边缘设备)的情况下学习机器学习模型。因此,设计在计算、通信和能耗方面高效,同时确保符合FL框架隐私要求的解决方案至关重要。针对这些问题的传统方法会选择训练数据集的一个加权子集,称为核心集,并通过在其上拟合模型来进行学习。此类核心集选择方法也被认为对数据噪声具有鲁棒性。然而,这些方法依赖于训练数据的整体统计信息,不易扩展到FL设置。在本文中,我们提出了一种名为基于梯度的核心集用于鲁棒高效联邦学习(GCFL)的算法,该算法在每个客户端仅每KK轮通信选择一个核心集,并仅从中推导更新,前提是服务器上有一个小的验证数据集可用。我们证明了我们的核心集选择技术在应对客户端数据中的噪声方面非常有效。我们使用四个真实世界数据集进行了实验,并表明GCFL (1) 比FL更节省计算和能源,(2) 对特征空间和标签中的各种噪声具有鲁棒性,(3) 保护了验证数据集的隐私,(4) 引入了较小的通信开销,但在性能上取得了显著提升,尤其是在客户端数据有噪声的情况下。

关键词

引用

@article{arxiv.2401.06989,
  title  = {Gradient Coreset for Federated Learning},
  author = {Durga Sivasubramanian and Lokesh Nagalapatti and Rishabh Iyer and Ganesh Ramakrishnan},
  journal= {arXiv preprint arXiv:2401.06989},
  year   = {2024}
}

备注

Accepted at WACV-24