中文

于一簇神经元中窥见世界:解耦多任务干扰以实现免训练模型合并

机器学习 2025-09-11 v4 人工智能

摘要

在目标数据集上微调预训练模型可提升特定任务的性能,但往往以牺牲泛化能力为代价。模型合并技术通过任务算术将多个微调模型集成为单一多任务模型,提供了一种有前景的解决方案。然而,任务干扰仍然是一个根本性挑战,会导致性能下降和合并模型次优。现有方法在很大程度上忽略了神经元及其连接性和激活的基本作用,导致合并过程和合并模型未考虑神经元如何传递和处理信息。在本工作中,我们提出了首个依赖神经元机制进行模型合并的研究。具体而言,我们将特定任务的表示分解为两个互补的神经元子空间,分别调节输入敏感性和任务适应性。利用这种分解,我们引入了 NeuroMerging,这是一个旨在减轻神经元子空间内任务干扰的新型合并框架,能够实现跨多种任务的免训练模型融合。通过大量实验,我们证明了 NeuroMerging 在自然语言和视觉领域的多任务基准上均取得了优于现有方法的性能。我们的发现强调了在模型合并中对齐神经元机制的重要性,为减轻任务干扰和改善知识融合提供了新见解。我们的项目可在 https://ZzzitaoFang.github.io/projects/NeuroMerging/ 获取。

关键词

引用

@article{arxiv.2503.05320,
  title  = {To See a World in a Spark of Neuron: Disentangling Multi-task Interference for Training-free Model Merging},
  author = {Zitao Fang and Guodong DU and Shuyang Yu and Yifei Guo and Yiwei Zhang and Yiyao Cao and Jing Li and Ho-Kin Tang and Sim Kuan Goh},
  journal= {arXiv preprint arXiv:2503.05320},
  year   = {2025}
}

备注

Accepted to EMNLP 2025 Main Conference. This is the camera-ready version. Code: https://ZzzitaoFang.github.io/projects/NeuroMerging/