中文

联邦学习中的非独立同分布数据:分类、度量、方法、框架与未来方向的综述

机器学习 2024-12-13 v2

摘要

机器学习的最新进展凸显了联邦学习 (Federated Learning, FL) 作为一种极具前景的方法,它使多个分布式用户(即所谓的客户端)能够在不共享其私有数据的情况下协同训练 ML 模型。尽管这种保护隐私的方法显示出潜力,但当客户端间的数据不是独立同分布 (non-IID) 时,它会遇到困难。后者仍然是一个未解决的挑战,可能导致模型性能下降和训练时间变慢。尽管非独立同分布数据在联邦学习中具有重要意义,但研究人员对其分类和量化缺乏共识。本技术综述旨在通过为非独立同分布数据、划分协议和量化数据异构性的度量提供详细的分类体系来填补这一空白。此外,我们描述了解决非独立同分布数据的流行解决方案以及联邦学习中处理异构数据所采用的标准框架。基于我们最前沿的综述,我们总结了关键经验教训,并提出了有前景的未来研究方向。

关键词

引用

@article{arxiv.2411.12377,
  title  = {Non-IID data in Federated Learning: A Survey with Taxonomy, Metrics, Methods, Frameworks and Future Directions},
  author = {Daniel M. Jimenez G. and David Solans and Mikko Heikkila and Andrea Vitaletti and Nicolas Kourtellis and Aris Anagnostopoulos and Ioannis Chatzigiannakis},
  journal= {arXiv preprint arXiv:2411.12377},
  year   = {2024}
}