初始化的重要性:解构预训练对联邦学习影响
机器学习
2025-02-13 v1 分布式、并行与集群计算
摘要
在下游任务上进行学习时使用预训练模型的初始化正在成为机器学习中的标准做法。最近几项工作探索了预训练初始化在联邦学习(FL)设置下的优势,其中下游训练在数据分布异构的边缘客户端上进行。这些工作表明,starting from a pre-trained model 可以在不改变标准 FedAvg 训练算法的前提下,显著降低数据异构性对联邦设置下模型测试性能的负面影响。在本工作中,我们提供了对这一现象更深入的理论理解。为此,我们研究了两层卷积神经网络(CNN)的类别,并给出该网络使用 FedAvg 训练时的训练误差收敛和测试误差的上界。我们引入对初始化时滤波器对齐与非对齐的概念,并指出数据异构性仅影响非对齐滤波器上的学习。starting with a pre-trained model 通常会导致初始化时非对齐滤波器更少,从而即使在联邦设置下进行数据异构性训练也能产生更低的测试误差。合成环境下的实验以及实际 FL 训练 CNN 的实验验证了我们的理论发现。
引用
@article{arxiv.2502.08024,
title = {Initialization Matters: Unraveling the Impact of Pre-Training on Federated Learning},
author = {Divyansh Jhunjhunwala and Pranay Sharma and Zheng Xu and Gauri Joshi},
journal= {arXiv preprint arXiv:2502.08024},
year = {2025}
}