中文

草图自适应联邦深度学习:尖锐的收敛性分析

机器学习 2025-04-15 v3

摘要

将梯度压缩方法(如 CountSketch、量化)与自适应优化器(如 Adam、AMSGrad)相结合是联邦学习(FL)中的理想目标,有望同时减少通信轮次和每轮通信量。尽管草图自适应方法的初步实证成功已有报道,但现有的收敛性分析表明通信代价与环境的维数(即参数数量)呈线性关系,这对现代深度学习模型而言是不可接受的。在本工作中,我们引入了特定的草图自适应联邦学习(SAFL)算法,并且作为主要贡献,在不同的 FL 设置下提供了理论收敛性分析,保证通信代价仅对环境维数呈对数依赖(而非线性依赖)。与现有分析不同,我们表明 SAFL 中预处理器和一阶矩中存在的逐元草图噪声可以通过利用深度学习损失中近期流行的各向异性曲率(例如快速衰减的损失 Hessian 特征值)来隐式处理。在 FL 的 i.i.d. 客户端设置下,我们证明 SAFL 达到了渐近 O(1/T)O(1/\sqrt{T}) 收敛,并且在初始轮次收敛更快。在非 i.i.d. 客户端设置下,非自适应方法缺乏收敛性保证,我们证明 SACFL(带裁剪的 SAFL)算法尽管存在额外的重尾噪声仍可严格收敛。我们的理论结论得到了视觉和语言任务实证研究的支持,并且在微调和从头训练两种设置下均成立。令人惊讶的是,作为我们分析的副产品,所提出的 SAFL 方法与基于误差反馈的最先进的通信高效联邦学习算法具有竞争力。

关键词

引用

@article{arxiv.2411.06770,
  title  = {Sketched Adaptive Federated Deep Learning: A Sharp Convergence Analysis},
  author = {Zhijie Chen and Qiaobo Li and Arindam Banerjee},
  journal= {arXiv preprint arXiv:2411.06770},
  year   = {2025}
}