中文

联邦学习中非 IID 数据影响的全面评估

机器学习 2025-07-17 v2 人工智能 机器学习

摘要

联邦学习(FL)允许在分散的客户端之间进行协同机器学习(ML)模型训练,确保数据隐私。FL 的去中心化特性处理非独立且相同分布(non-IID)的数据。这一开放问题具有显著影响,例如模型性能下降和更长的收敛时间。尽管如此,针对所有类型数据异构性(即非 IIDness)的实验研究仍稀缺。我们旨在通过全面的经验分析来填补这一空白,对非 IID 效应进行评估和量化。我们使用 Hellinger Distance(HD)来衡量客户端之间分布差异的程度。我们的研究在现实且受控的条件下,对四种处理非 IID 数据的领先策略进行基准测试,包括标签、特征、数量和时空不均衡。这是对时空偏斜效应在 FL 中进行全面分析的首次工作。我们的发现表明,标签和时空偏斜非 IID 类型对 FL 模型性能影响显著,在特定 HD 阈值处会出现显著的性能下降。此外,FL 性能主要在非 IIDness 极端时才受到显著影响。因此,我们为 FL 研究提供了建议,以有效应对数据异构性。本工作代表了对 FL 中非 IIDness 最广泛的检查,为未来研究提供了稳健的基础。

关键词

引用

@article{arxiv.2503.17070,
  title  = {A Thorough Assessment of the Non-IID Data Impact in Federated Learning},
  author = {Daniel M. Jimenez-Gutierrez and Mehrdad Hassanzadeh and Aris Anagnostopoulos and Ioannis Chatzigiannakis and Andrea Vitaletti},
  journal= {arXiv preprint arXiv:2503.17070},
  year   = {2025}
}