中文

合成数据混洗加速数据异构下联邦学习的收敛

机器学习 2024-04-09 v2 计算机视觉与模式识别 分布式、并行与集群计算

摘要

在联邦学习中,数据异构是一个关键挑战。一个直接的解决方案是混洗客户端数据以同质化分布。然而,这可能侵犯数据访问权,且混洗如何以及何时能加速联邦优化算法的收敛在理论上尚未被充分理解。本文中,我们在跨客户端混洗部分数据时,建立了数据异构与收敛速率中参数之间的精确可量化对应关系。我们证明混洗可相对于混洗比例二次地降低梯度不相似度,从而加速收敛。受该理论启发,我们提出了一种实用方法,通过混洗本地生成的合成数据来解决数据访问权问题。实验结果表明,混洗合成数据大幅提升了多种现有联邦学习算法的性能。

关键词

引用

@article{arxiv.2306.13263,
  title  = {Synthetic data shuffling accelerates the convergence of federated learning under data heterogeneity},
  author = {Bo Li and Yasin Esfandiari and Mikkel N. Schmidt and Tommy S. Alstrøm and Sebastian U. Stich},
  journal= {arXiv preprint arXiv:2306.13263},
  year   = {2024}
}

备注

Accepted at TMLR