中文

Twin-Merging:模型合并中模块化专长的动态集成

计算与语言 2024-10-15 v2 人工智能 机器学习

摘要

在大型语言模型时代,模型合并是将多个任务特定模型整合到单个多任务模型中的有前景方法,无需额外训练。然而,仍存在两个挑战:(a)不同模型之间的干扰;(b)测试期间异构数据的存在。传统模型合并方法因这些问题在性能上与微调模型存在显著差距。此外,单一通用模型缺乏对多样化测试数据的灵活性,导致性能下降。我们表明,共享和专属任务特定知识都是合并性能的关键,但直接合并专属知识会损害整体性能。鉴于此,我们提出了Twin-Merging方法,包含两个主要阶段:(1)将知识模块化分为共享和专属组件,并进行压缩以减少冗余并提高效率;(2)基于输入动态地合并共享和任务特定知识。该方法缩小了合并模型与微调模型之间的性能差距,并提高了对异构数据的适应性。在针对语言和视觉任务的20个数据集上进行大量实验,显示我们方法的有效性,在判别性任务中实现了在归一化评分上的平均提升28.34%,甚至在生成式任务中超越了微调上限。我们的实现已在https://github.com/LZY-the-boys/Twin-Merging 上提供。

关键词

引用

@article{arxiv.2406.15479,
  title  = {Twin-Merging: Dynamic Integration of Modular Expertise in Model Merging},
  author = {Zhenyi Lu and Chenghao Fan and Wei Wei and Xiaoye Qu and Dangyang Chen and Yu Cheng},
  journal= {arXiv preprint arXiv:2406.15479},
  year   = {2024}
}

备注

NeurIPS 2024 poster