中文

基于加权动量与锐度感知最小化的快速平坦联邦学习方法

机器学习 2025-12-01 v1 人工智能 分布式、并行与集群计算

摘要

在联邦学习(FL)中,模型必须在紧张的通信预算下快速收敛,同时在非 IID 客户端分布下具备良好泛化能力。这两个要求自然导致了两种广泛使用的技术:客户端/服务器动量以加速进展,以及锐度感知最小化(SAM)以优先选择平坦解。然而,仅简单组合动量与 SAM 仍未解决非 IID FL 中的两个结构性问题。我们识别并形式化了两种失效模式:局部-全局曲率错位(局部 SAM 方向未必反映全局损失几何)以及动量-回声振荡(由累积动量引起的后期不稳定)。鉴于上述失效模式在 FL 文献中尚未被统一阐述与解决,我们提出了 FedWMSAM 方法以应对两种失效模式。首先,我们构建由服务器聚合动量引导的全局扰动,以将客户端的 SAM 方向与全局下降几何对齐,实现“单向反向传播”SAM 近似,保持效率。其次,我们通过余弦相似度自适应规则将动量与 SAM 耦合,形成早期动量、晚期 SAM 两阶段训练计划。我们提供了非 IID 收敛上界,显式建模扰动引起的方差 σρ2=σ2+(Lρ)2\sigma_\rho^2=\sigma^2+(L\rho)^2,并阐明其对 (S,K,R,N)(S, K, R, N) 的依赖。我们进行了在多个数据集和模型架构上的大量实验,结果表明该方法在有效性、适应性和鲁棒性方面均优于现有方法,证明其在联邦学习优化中具有优势。我们的代码已公开于 https://github.com/Huang-Yongzhi/NeurlPS_FedWMSAM。

关键词

引用

@article{arxiv.2511.22080,
  title  = {A Fast and Flat Federated Learning Method via Weighted Momentum and Sharpness-Aware Minimization},
  author = {Tianle Li and Yongzhi Huang and Linshan Jiang and Chang Liu and Qipeng Xie and Wenfeng Du and Lu Wang and Kaishun Wu},
  journal= {arXiv preprint arXiv:2511.22080},
  year   = {2025}
}