中文

以灵活模型合并导航精度-大小权衡

计算机视觉与模式识别 2026-04-15 v3

摘要

模型合并已成为组合多个单任务微调模型的有效方法。合并后的模型可以具备多任务能力,而无需昂贵的训练。虽然前景广阔,但合并成单个模型通常与微调模型之间存在精度差距。另一方面,部署所有单独的微调模型会产生高昂的存储成本。我们提出了 FlexMerge,一种新颖的无数据模型合并框架,它: 灵活生成不同大小的合并模型,涵盖了从单个合并模型到保留所有微调模型的完整范围; 在统一框架中支持多种合并算法。使用 FlexMerge,我们系统地刻画了不同算法的精度-大小权衡。我们的研究揭示了两个关键发现:首先,即使稍大的合并模型也能带来急剧的精度提升(在大小翻倍时高达 13.5%);其次,随着大小的增加,算法排名并不一致,某些方法在超出单模型范围后会超越其他方法。这些结果揭示了模型合并的一个新设计维度:在完整的大小范围内开发和比较算法,而不仅仅局限于单模型极限。在视觉和 NLP 基准上的大量实验(多达 30 个任务)证实了 FlexMerge 的通用性和实用性。

关键词

引用

@article{arxiv.2505.23209,
  title  = {Navigating the Accuracy-Size Trade-Off with Flexible Model Merging},
  author = {Akash Dhasade and Divyansh Jhunjhunwala and Milos Vujasinovic and Gauri Joshi and Anne-Marie Kermarrec},
  journal= {arXiv preprint arXiv:2505.23209},
  year   = {2026}
}

备注

Accepted at ICLR 2026