中文

分布式学习中的异构性更重要:从泛化视角的研究

机器学习 2025-05-21 v2 信息论 math.IT 机器学习

摘要

本文从泛化误差的角度 investigates 数据在不同客户端之间异构性对分布式学习系统性能的影响,即一种轮数的Federated Learning。具体而言,KK个客户端各自拥有n个训练样本,根据可能不同的分布独立生成,其选定的模型由中心服务器聚合。我们研究了客户端数据分布之间差异对聚合模型泛化误差的影响。首先,我们建立了关于分布的泛化误差的线性期望上界和尾部上界。部分地,这些上界扩展了为集中学习设置(即K=1K=1)开发的流行的条件互信息(CMI)上界,适用于任意客户端数目为K1K \geq 1的分布式学习设置。随后,我们与信息论中的 rate-distortion 理论相连接,推导出可能更紧的损失型上界。接下来,我们将这些损失型上界应用于研究数据在不同客户端之间的异构性如何影响分布式分类问题中泛化误差,后者每个客户端使用支持向量机(DSVM)。在这种情况下,我们建立了显式的泛化误差上界,其依赖于数据异构性程度。结果表明,随着客户端之间训练样本异构性程度的增加,上界变小,从而表明DSVM在训练样本之间的dissimilarity更大时能更好地泛化。这种发现超越了DSVM,通过几个实验得到了实验验证。

关键词

引用

@article{arxiv.2503.01598,
  title  = {Heterogeneity Matters even More in Distributed Learning: Study from Generalization Perspective},
  author = {Masoud Kavian and Romain Chor and Milad Sefidgaran and Abdellatif Zaidi},
  journal= {arXiv preprint arXiv:2503.01598},
  year   = {2025}
}

备注

47 pages, 13 figures