中文

深度学习中面向协同平坦最优解的通信高效分布式训练

机器学习 2025-10-13 v2 分布式、并行与集群计算

摘要

我们研究深度神经网络 (DNN) 的中心化分布式数据并行训练,旨在改善局部梯度方法在通信效率与模型性能之间的权衡。为此,我们重新审视平坦最优假设——即表明模型泛化能力更好的模型位于损失景观的较平坦区域。我们引入一种简单的有效锐度度量——Inverse Mean Valley,证明其与 DNN 泛化间隙强相关。我们将该度量的高效松弛形式纳入分布式训练目标作为轻量级正则器,鼓励工作节点协同寻找宽极小值。该正则器产生一个推力,抵消工作节点间一致性步骤的拉力,形成 Distributed Pull-Push Force (DPPF) 算法。经验上,我们表明 DPPF 在保持通信效率的同时,超越其他通信高效方法,优于局部梯度方法和同步梯度平均,在泛化性能上表现更佳。此外,我们的损失景观可视化证实了 DPPF 定位更平坦极小值的能力。理论上,我们证明 DPPF 指引工作节点跨越平坦山谷,最终山谷宽度由推力与拉力强度的相互作用决定,其拉力-推力动力学具有自稳定特性。我们进一步提供与山谷宽度关联的泛化保证,并证明非凸情形下的收敛性。

关键词

引用

@article{arxiv.2507.20424,
  title  = {Communication-Efficient Distributed Training for Collaborative Flat Optima Recovery in Deep Learning},
  author = {Tolga Dimlioglu and Anna Choromanska},
  journal= {arXiv preprint arXiv:2507.20424},
  year   = {2025}
}

备注

8 pages main body, 33 pages of supplementary material for hyperparameter configurations, full proofs of theorems and additional results