中文

揭示 LoRA 干扰:用于鲁棒模型合并的正交子空间

计算与语言 2025-05-30 v1 人工智能 机器学习

摘要

为单个任务微调大型语言模型(LMs)能产生出色的性能,但在部署和存储方面成本高昂。近期的工作探索了模型合并,旨在无需额外训练的情况下将多个特定任务模型组合成一个多任务模型。然而,由于显著的性能下降,现有的合并方法对于使用低秩适配(LoRA)微调的模型常常失效。在本文中,我们表明该问题源于模型参数与数据分布之间此前被忽视的相互作用。我们提出了用于鲁棒模型合并的正交子空间(OSRM),在微调之前约束 LoRA 子空间,确保与一个任务相关的更新不会对其他任务的输出产生不利影响。我们的方法可以与大多数现有的合并算法无缝集成,减少任务之间无意的干扰。在八个数据集上,使用三个广泛使用的 LMs 和两个大型 LMs 进行了大量实验,结果表明我们的方法不仅提升了合并性能,还保持了单任务准确率。此外,我们的方法对合并超参数表现出更强的鲁棒性。这些结果突出了数据-参数相互作用在模型合并中的重要性,并为合并 LoRA 模型提供了一种即插即用的解决方案。

关键词

引用

@article{arxiv.2505.22934,
  title  = {Unraveling LoRA Interference: Orthogonal Subspaces for Robust Model Merging},
  author = {Haobo Zhang and Jiayu Zhou},
  journal= {arXiv preprint arXiv:2505.22934},
  year   = {2025}
}

备注

14 pages, 5 figures, 16 tables, accepted by ACL 2025