中文

分解-重归一化-合并:在正确空间上进行模型合并以提升多任务能力

机器学习 2025-10-30 v2 人工智能

摘要

在大规模训练时代,模型合并已演变为一种高效创建多任务模型的工具。它能够融合模型知识,而无需传统多任务学习所需的大量计算。现有的合并方法通常假设权重矩阵中相同位置的条目具有相同的功能,从而实现直接的逐元素比较和合并。然而,这种假设忽略了微调神经网络的复杂性,其中神经元可能发展出不同的特征组合,使得直接的逐元素合并存在问题。我们提出了 Decom-Renorm-Merge(DRM),一种简单而有效的方法,该方法利用奇异值分解将权重矩阵分解并协调到一个对齐的联合空间中,使得逐元素合并成为可能。我们展示了 DRM 在各种设置下的有效性,范围从较小的基于编码器的模型(如 ViT 和 DeBERTa)、基于编码器-解码器的模型(如 T5),到较大的基于解码器的模型(如 Llama3.1-8B)。我们的实验结果表明,DRM 在全量微调和低秩适配设置下均优于多种最先进的合并技术。此外,我们的分析揭示,重归一化是创建用于合并的鲁棒且均匀的联合空间的关键组件,对该方法的性能做出了重大贡献。

关键词

引用

@article{arxiv.2505.23117,
  title  = {Decom-Renorm-Merge: Model Merging on the Right Space Improves Multitasking},
  author = {Yuatyong Chaichana and Thanapat Trachu and Peerat Limkonchotiwat and Konpat Preechakul and Tirasan Khandhawit and Ekapol Chuangsuwanich},
  journal= {arXiv preprint arXiv:2505.23117},
  year   = {2025}
}

备注

Code and models are available at https://github.com/yophis/decom-renorm-merge