HeteroSwitch:表征并抑制联邦学习中的系统诱导数据异质性
机器学习
2024-05-13 v2 分布式、并行与集群计算
摘要
联邦学习 (FL) 是一种在用户端设备上协作训练深度学习模型的实用方法,通过将原始数据保留在设备上来保护用户隐私。在 FL 中,参与的用户端设备在硬件和软件配置上高度碎片化。这种碎片化在 FL 中引入了一种新型的数据异质性,即系统诱导数据异质性,因为每个设备根据其硬件和软件配置生成独特的数据。在本文中,我们首先表征了系统诱导数据异质性对 FL 模型性能的影响。我们收集了一个包含不同供应商和性能等级异构设备的数据集。利用该数据集,我们证明了系统诱导数据异质性会降低准确性,并加剧 FL 中的公平性和领域泛化问题。为应对这些挑战,我们提出了 HeteroSwitch,该方法根据由不同硬件和软件配置引起的偏差水平,自适应地采用泛化技术(即 ISP 变换和 SWAD)。在使用真实 FL 数据集 (FLAIR) 的评估中,HeteroSwitch 将不同设备类型的平均精度方差降低了 6.3%。
引用
@article{arxiv.2403.04207,
title = {HeteroSwitch: Characterizing and Taming System-Induced Data Heterogeneity in Federated Learning},
author = {Gyudong Kim and Mehdi Ghasemi and Soroush Heidari and Seungryong Kim and Young Geun Kim and Sarma Vrudhula and Carole-Jean Wu},
journal= {arXiv preprint arXiv:2403.04207},
year = {2024}
}