受控不一致可提升去中心化训练中的泛化能力
机器学习
2026-02-04 v1 分布式、并行与集群计算
摘要
去中心化训练常被视为劣于集中训练,因为人们认为工人的共识误差会削弱收敛和泛化,即使数据分布均匀。本工作通过引入自适应共识(DSGD-AC)的去中心化 SGD,刻意保留非消失的共识误差,通过时变缩放机制实现这一点。我们证明,这些误差并非随机噪声,而是系统地与主导 Hessian 子空间对齐,作为结构化扰动引导优化走向更平坦的最小值。在图像分类和机器翻译基准测试中,DSGD-AC 始终优于标准 DSGD 和集中式 SGD,在测试准确率和解的平坦性方面均表现更佳。这些结果共同表明,共识误差是一种有用的隐式正则化器,为去中心化学习算法的设计开辟了新的视角。
关键词
引用
@article{arxiv.2602.02899,
title = {Controlled disagreement improves generalization in decentralized training},
author = {Zesen Wang and Mikael Johansson},
journal= {arXiv preprint arXiv:2602.02899},
year = {2026}
}