中文

解决干扰 (RI):用于改进模型合并的解耦模型

机器学习 2026-03-17 v1 人工智能 计算与语言 计算机视觉与模式识别

摘要

模型合并表明,可以通过直接组合在感兴趣任务上各专精化的不同模型的参数来创建多任务模型。然而,针对不同任务独立训练的模型常常 exhibits 干扰,导致合并后模型性能下降。为解决此问题,我们正式定义了跨任务干扰的概念,即合并后模型相对于其组成模型的表示漂移。减少跨任务干扰是提高合并性能的关键。为此,我们提出了我们的方法,解决干扰 (RI),一种轻量级适应框架,通过解耦专家模型,使其与其他任务的表示空间正交,从而减少跨任务干扰。RI 只需使用未标记的辅助数据作为输入(即不需要任务数据),可应用于数据稀缺的场景。RI 一致地将最新合并方法的性能提升最高可达 3.8%,并提升对未见域的泛化能力最高可达 2.3%。我们还发现 RI 对辅助输入的来源鲁棒性强,对合并超参数的调谐灵敏度显著降低。我们的 codebases 可在 https://github.com/pramesh39/resolving_interference 获取。

关键词

引用

@article{arxiv.2603.13467,
  title  = {Resolving Interference (RI): Disentangling Models for Improved Model Merging},
  author = {Pratik Ramesh and George Stoica and Arun Iyer and Leshem Choshen and Judy Hoffman},
  journal= {arXiv preprint arXiv:2603.13467},
  year   = {2026}
}