去中心化SGD的拓扑感知泛化
机器学习
2025-04-15 v5 机器学习
摘要
本文研究了去中心化随机梯度下降(D-SGD)的算法稳定性与可泛化性。我们证明了在非凸非光滑设定下,D-SGD学习到的共识模型在期望意义下具有的稳定性,其中为总样本量,为工作节点数,为衡量通信拓扑连通性的谱间隙。这些结果进一步给出了一个的平均泛化界,即使当接近时该界仍为非平凡的,而现有关于D-SGD投影版本的文献表明此时泛化界是平凡的。我们的理论表明,D-SGD的可泛化性与谱间隙正相关,并能解释为何在初始训练阶段进行共识控制可确保更好的泛化。在CIFAR-10、CIFAR-100和Tiny-ImageNet上使用VGG-11和ResNet-18的实验验证了我们的理论。据我们所知,这是首个关于原始D-SGD拓扑感知泛化的工作。代码见https://github.com/Raiden-Zhu/Generalization-of-DSGD。
引用
@article{arxiv.2206.12680,
title = {Topology-aware Generalization of Decentralized SGD},
author = {Tongtian Zhu and Fengxiang He and Lan Zhang and Zhengyang Niu and Mingli Song and Dacheng Tao},
journal= {arXiv preprint arXiv:2206.12680},
year = {2025}
}
备注
Accepted for publication in the 39th International Conference on Machine Learning (ICML 2022)