中文

去中心化SGD的拓扑感知泛化

机器学习 2025-04-15 v5 机器学习

摘要

本文研究了去中心化随机梯度下降(D-SGD)的算法稳定性与可泛化性。我们证明了在非凸非光滑设定下,D-SGD学习到的共识模型在期望意义下具有O(N1+m1+λ2)\mathcal{O}{(N^{-1}+m^{-1} +\lambda^2)}的稳定性,其中NN为总样本量,mm为工作节点数,1+λ1+\lambda为衡量通信拓扑连通性的谱间隙。这些结果进一步给出了一个O(N(1+α)/2+m(1+α)/2+λ1+α+ϕS)\mathcal{O}{(N^{-(1+\alpha)/2}+ m^{-(1+\alpha)/2}+\lambda^{1+\alpha} + \phi_{\mathcal{S}})}的平均泛化界,即使当λ\lambda接近11时该界仍为非平凡的,而现有关于D-SGD投影版本的文献表明此时泛化界是平凡的。我们的理论表明,D-SGD的可泛化性与谱间隙正相关,并能解释为何在初始训练阶段进行共识控制可确保更好的泛化。在CIFAR-10、CIFAR-100和Tiny-ImageNet上使用VGG-11和ResNet-18的实验验证了我们的理论。据我们所知,这是首个关于原始D-SGD拓扑感知泛化的工作。代码见https://github.com/Raiden-Zhu/Generalization-of-DSGD。

关键词

引用

@article{arxiv.2206.12680,
  title  = {Topology-aware Generalization of Decentralized SGD},
  author = {Tongtian Zhu and Fengxiang He and Lan Zhang and Zhengyang Niu and Mingli Song and Dacheng Tao},
  journal= {arXiv preprint arXiv:2206.12680},
  year   = {2025}
}

备注

Accepted for publication in the 39th International Conference on Machine Learning (ICML 2022)