更多参数会造成损害:在极端联邦异构性下,基础模型先验放大最差客户差距
机器学习
2026-05-12 v1
摘要
联邦学习(FL)越来越多地用于在分布式私有数据上微调基础模型(Foundation Models, FMs)。社区主要假设大规模预训练在联邦设置下充当“举涛”般的提升一切船只的力量。然而,我们的实验揭示了这些强大先验反而可能阻碍最不利利益客户。在受控的文本分类联邦实验中,我们比较了 TextCNN(270 万参数)和带低秩适配(LoRA,6600 万参数)的 DistilBERT 在四个非独立同分布异构性水平下的最差客户准确率。在极端标签偏斜(alpha=0.1)时,DistilBERT+LoRA 产生的差距为 50.1%——比 TextCNN 的 32.2% 大 56%,尽管参数数目是后者的 25 倍且进行了广泛预训练。在适度异构性(alpha >= 0.5)时,模式反转:FM 几乎消除了差距。我们称之为 FM 公平性悖论。我们进一步表明,逆加权 LoRA 聚合方法(FedAvgW)并不能解决差距,这表明仅靠聚合加权可能不足。我们的结果凸显了在医疗和教育等高风险联邦环境中部署基础模型前,需要针对少数客户实施的机制。
引用
@article{arxiv.2605.08992,
title = {When More Parameters Hurt: Foundation Model Priors Amplify Worst-Client Disparity Under Extreme Federated Heterogeneity},
author = {Kiran Naseer and Umar Shoaib},
journal= {arXiv preprint arXiv:2605.08992},
year = {2026}
}
备注
7 pages, 5 figures. Submitted to FL@FM-IJCAI 2026 Workshop