理解层归一化在标签偏斜联邦学习中的作用
机器学习
2024-02-16 v2 机器学习
摘要
层归一化(LN)是一种被广泛采用的深度学习技术,尤其在基础模型时代。最近,LN 被证明在具有非独立同分布(non-i.i.d.)数据的联邦学习(FL)中出奇地有效。然而,其确切的原因与机制仍不明朗。在本工作中,我们揭示了层归一化与联邦学习中标签偏移问题之间的深刻联系。为了更好地理解 FL 中的层归一化,我们确定了归一化方法在 FL 中的关键贡献机制,称为特征归一化(FN),它在分类器头之前对潜在特征表示施加归一化。尽管 LN 和 FN 不提升表达能力,但它们控制了特征坍缩以及对高度偏斜数据集的局部过拟合,从而加速全局训练。在经验上,我们表明在极端标签偏移下的标准基准上,归一化带来了显著改进。此外,我们进行了广泛的消融实验以理解 FL 中层归一化的关键因素。我们的结果验证了 FN 是 LN 内部显著提升 FL 收敛性、同时对学习率选择保持鲁棒性的关键成分,尤其在每个客户端仅能访问少数类别的极端标签偏移下。我们的代码可在 \url{https://github.com/huawei-noah/Federated-Learning/tree/main/Layer_Normalization} 获取。
引用
@article{arxiv.2308.09565,
title = {Understanding the Role of Layer Normalization in Label-Skewed Federated Learning},
author = {Guojun Zhang and Mahdi Beitollahi and Alex Bie and Xi Chen},
journal= {arXiv preprint arXiv:2308.09565},
year = {2024}
}
备注
accepted at TMLR