驯服联邦学习中的重尾(具有潜在无限方差的“更重尾”)噪声
机器学习
2022-12-27 v2 人工智能
分布式、并行与集群计算
摘要
现有大多数关于联邦学习(FL)算法收敛性分析的工作中的一个关键假设是,随机一阶信息中的噪声具有有限方差。尽管该假设涵盖了所有轻尾(即亚指数)和一些重尾噪声分布(例如对数正态、威布尔和某些帕累托分布),但它无法适用于 FL 文献中经验观察到的许多重尾噪声分布(即具有潜在无限方差的“更重尾”)。迄今为止,能否为经历重尾噪声的 FL 系统设计收敛算法仍不清楚。这促使我们在本文中填补这一空白,提出一种称为 FAT-Clipping(带双侧学习率和裁剪的联邦平均)的算法框架,它包含两个变体:每轮 FAT-Clipping(FAT-Clipping-PR)和每迭代 FAT-Clipping(FAT-Clipping-PI)。具体而言,对于使得 FL 中的重尾噪声仍具有有界 α-矩的最大 α ∈ (1,2],我们证明两个变体在强凸和一般非凸设定下分别达到 O((mT)^{(2-α)/α}) 和 O((mT)^{(1-α)/(3α-2)}) 的收敛速率,其中 m 和 T 分别为客户端数量和通信轮数。此外,与 FAT-Clipping-PR 相比,FAT-Clipping-PI 以更多裁剪操作为代价,进一步享有相对于每个客户端本地更新次数的线性加速效应,并且达到下界匹配(即阶最优)。总之,我们的结果增进了对为呈现重尾一阶预言机信息的 FL 系统设计高效算法的理解。
引用
@article{arxiv.2210.00690,
title = {Taming Fat-Tailed ("Heavier-Tailed'' with Potentially Infinite Variance) Noise in Federated Learning},
author = {Haibo Yang and Peiwen Qiu and Jia Liu},
journal= {arXiv preprint arXiv:2210.00690},
year = {2022}
}
备注
Published as a conference paper at NeurIPS 2022