中文

解耦与正交化:LoRA合并的无数据框架

计算机视觉与模式识别 2025-05-23 v1 机器学习

摘要

随着越来越多面向多样化任务的开源模型可用,模型合并受到关注,通过将模型合并为一个来减少训练、存储和推理成本。当前研究主要聚焦于全微调的模型合并,忽视了广受欢迎的LoRA。然而,我们的经验分析揭示:a)现有为全微调设计的合并方法在LoRA上表现不佳;b)LoRA模块的参数幅度方差远大于全微调权重;c)更大的参数幅度方差与更差的合并性能相关。考虑到大幅度方差导致合并参数分布的偏差,造成信息丢失和性能退化,我们提出了一种解耦与正交合并方法(DO-Merging)。通过将参数分离为幅度和方向分量并独立合并,我们减少了幅度差异对合并模型方向对齐的影响,从而保留了任务信息。此外,我们引入了一种无数据的、逐层的带正交约束的梯度下降方法,以缓解方向分量合并过程中的干扰。我们为解耦和正交两个分量提供了理论保证,并通过在视觉、语言和多模态领域的广泛实验验证了我们提出的DO-Merging能够以最小成本实现显著优于现有合并方法的性能。值得注意的是,每个分量都可以灵活地与现有方法集成,在各项任务上提供接近免费的改进。

关键词

引用

@article{arxiv.2505.15875,
  title  = {Decouple and Orthogonalize: A Data-Free Framework for LoRA Merging},
  author = {Shenghe Zheng and Hongzhi Wang and Chenyu Huang and Xiaohui Wang and Tao Chen and Jiayuan Fan and Shuyue Hu and Peng Ye},
  journal= {arXiv preprint arXiv:2505.15875},
  year   = {2025}
}

备注

9 pages, 5 figures