从独立同分布到非独立同分布数据集理解联邦学习:一项实验研究
机器学习
2025-06-04 v3 人工智能
机器学习
摘要
随着隐私担忧和数据法规的加剧,联邦学习(FL)已成为一种在不共享原始数据的情况下,跨分散数据源训练机器学习模型的有前景方法。然而,联邦学习面临的一个显著挑战是客户端数据通常是非独立同分布(non-IID)的,导致与集中式学习相比性能下降。尽管已提出许多方法来解决此问题,但其底层机制常从不同视角进行审视。通过从梯度下降到联邦学习,以及从独立同分布(IID)到非独立同分布数据设置的全面研究,我们发现客户端损失景观的不一致是导致非独立同分布场景下性能下降的主要原因。基于这一理解,我们观察到现有方法可归纳为两大类策略:(1)调整参数更新路径和(2)修改客户端损失景观。这些发现为解决联邦学习中的非独立同分布挑战提供了清晰视角,并有助于指导该领域的未来研究。
引用
@article{arxiv.2502.00182,
title = {Understanding Federated Learning from IID to Non-IID dataset: An Experimental Study},
author = {Jungwon Seo and Ferhat Ozgur Catak and Chunming Rong},
journal= {arXiv preprint arXiv:2502.00182},
year = {2025}
}