中文

通过训练时神经元对齐与固定神经元锚点改进模型融合

机器学习 2025-10-28 v2 机器学习

摘要

模型融合旨在通过融合参数将多个深度神经网络(DNN)模型的知识整合为一个模型,它在提高基础模型的泛化能力和联邦学习中的参数平均等方面具有广阔的应用前景。然而,不同设置(数据、超参数等)下的模型具有不同的神经元排列;换言之,从损失景观的角度看,它们位于不同的损失盆地中,从而阻碍了模型融合的性能。为了缓解这个问题,先前的研究强调了排列不变性的作用,并开发了在训练后为神经元对齐找到正确网络排列的方法。与先前的尝试不同,本文研究了训练时神经元对齐,无需后匹配即可改进模型融合。训练时对齐比后对齐成本更低,且适用于各种模型融合场景。从基本假设和定理出发,我们引入了一种简单且无损的算法,称为TNA-PFN。TNA-PFN利用部分固定的神经元权重作为锚点,以减少训练时排列的可能性,并在降低线性模式连通性和多模型融合的障碍方面得到了实证验证。实验还验证了TNA-PFN可以在模型汤(视觉Transformer)和ColD融合(预训练语言模型)的设置下改进预训练模型的融合。基于TNA-PFN,我们提出了两种联邦学习方法FedPFN和FedPNU,展示了训练时神经元对齐的前景。FedPFN和FedPNU在异构设置下的联邦学习中达到了最先进的性能,并且可以与服务器端算法兼容。

关键词

引用

@article{arxiv.2402.01342,
  title  = {Improving Model Fusion by Training-time Neuron Alignment with Fixed Neuron Anchors},
  author = {Zexi Li and Zhiqi Li and Jie Lin and Tao Shen and Jun Xiao and Yike Guo and Tao Lin and Chao Wu},
  journal= {arXiv preprint arXiv:2402.01342},
  year   = {2025}
}

备注

IEEE Transactions on Pattern Analysis and Machine Intelligence