中文

FedAdamW: 面向联邦大模型的通信高效优化器及其收敛与泛化保证

机器学习 2026-04-21 v3 人工智能

摘要

AdamW 已成为训练大规模模型的最有效优化器之一,我们也观察到其在联邦学习(FL)环境中的有效性。然而,直接将 AdamW 应用于联邦学习场景存在诸多挑战:(1)由于数据异构性,AdamW 常常导致第二时刻估计 v\boldsymbol{v} 方差较大;(2)AdamW 的局部过拟合可能导致客户端漂移;(3)在每个轮次重新初始化时刻估计(v\boldsymbol{v}m\boldsymbol{m})会减慢收敛速度。为解决这些挑战,我们提出了第一个 \underline{Fed}erated \underline{AdamW} 算法,称为 \texttt{FedAdamW},用于训练和微调各种大型模型。\texttt{FedAdamW} 通过 \textbf{局部校正机制} 和解耦权重衰减来缓解局部过拟合。\texttt{FedAdamW} 高效地聚合 \texttt{mean} 第二时刻估计以降低其方差并重新初始化它们。理论上,我们证明 \texttt{FedAdamW} 在无 \textbf{异构性假设} 的情况下实现了线性加速收敛率 O((LΔσl2)/(SKRϵ2)+(LΔ)/R)\mathcal{O}(\sqrt{(L \Delta \sigma_l^2)/(S K R \epsilon^2)}+(L \Delta)/R),其中 SS 为每个轮次参与的客户端数,KK 为本地迭代次数,RR 为总通信轮次。我们还采用 PAC-Bayesian 泛化分析解释解耦权重衰减在本地训练中的有效性。实验上,我们在语言和视觉 Transformer 模型上验证了 \texttt{FedAdamW} 的有效性。与多个基线方法相比,\texttt{FedAdamW} 显著减少通信轮次并提高测试准确率。代码已发布于 https://github.com/junkangLiu0/FedAdamW。

关键词

引用

@article{arxiv.2510.27486,
  title  = {FedAdamW: A Communication-Efficient Optimizer with Convergence and Generalization Guarantees for Federated Large Models},
  author = {Junkang Liu and Fanhua Shang and Hongying Liu and Yuxuan Tian and Yuanyuan Liu and Jin Liu and Kewen Zhu and Zhouchen Lin},
  journal= {arXiv preprint arXiv:2510.27486},
  year   = {2026}
}