中文

克服联邦学习中的噪声与无关数据

机器学习 2020-06-24 v2 分布式、并行与集群计算 机器学习

摘要

许多图像和视觉应用需要大量数据用于模型训练。由于数据隐私和通信带宽限制,将所有此类数据收集到中心位置可能具有挑战性。联邦学习是一种以分布式方式从客户端设备收集的本地数据训练机器学习模型的有效方法,其不需要在客户端之间交换原始数据。一个挑战是,在每个客户端收集的大量多样数据中,很可能只有子集与学习任务相关,而其余数据对模型训练有负面影响。因此,在开始学习过程之前,选择与给定联邦学习任务相关的数据子集十分重要。在本文中,我们提出了一种分布式选择相关数据的方法,其中我们使用在小的、特定于任务的基准数据集上训练的基准模型,来评估每个客户端处单个数据样本的相关性,并选择具有足够高相关性的数据。然后,每个客户端仅在其数据的选定子集上用于联邦学习过程。我们提出的方法的有效性在具有大量客户端的模拟系统中的多个真实世界图像数据集上进行了评估,显示出与所有数据训练相比模型准确率提高多达 25%25\%

关键词

引用

@article{arxiv.2001.08300,
  title  = {Overcoming Noisy and Irrelevant Data in Federated Learning},
  author = {Tiffany Tuor and Shiqiang Wang and Bong Jun Ko and Changchang Liu and Kin K. Leung},
  journal= {arXiv preprint arXiv:2001.08300},
  year   = {2020}
}

备注

Accepted version in the 25th International Conference on Pattern Recognition (ICPR)