中文

分布式子模型训练的收敛性与稳定性

机器学习 2025-11-11 v1

摘要

随着模型规模的不断增大,为这些模型在边缘设备上进行本地训练已成为联邦学习中的关键挑战。一个流行的解决方案是子模型训练,其中服务器仅向边缘客户端分发随机抽取的子模型,客户端仅更新这些小型模型。然而,这些随机子模型抽样可能无法获得令人满意的收敛性能。本文观察到SGD随机化成功后,我们提出了分布式混洗子模型训练,其中将完整模型提前划分为多个子模型,服务器在每个轮次中混洗这些子模型并将其发送给客户端,在本地更新周期结束时,客户端将更新后的子模型发送回服务器,服务器对其进行平均。我们建立了该算法的收敛率。我们还通过稳定性分析研究了分布式子模型训练的泛化性能,发现子模型训练可以通过放大训练过程的稳定性来提高泛化。大量实验也验证了我们的理论发现。

关键词

引用

@article{arxiv.2511.06132,
  title  = {On the Convergence and Stability of Distributed Sub-model Training},
  author = {Yuyang Deng and Fuli Qiao and Mehrdad Mahdavi},
  journal= {arXiv preprint arXiv:2511.06132},
  year   = {2025}
}