中文

DC-Merge:通过方向一致性改进模型合并

机器学习 2026-03-17 v2 计算机视觉与模式识别

摘要

模型合并旨在将多个任务适应模型整合到一个保留每个任务知识的统一模型中。在本文中,我们识别到知识保留的关键在于维持合并后的多任务向量与各个任务向量之间奇异空间的方向一致性。然而,这种一致性常常因两个问题而被破坏:i) 任务向量内部能量分布不平衡,其中少数奇异值主导总能量,导致在合并过程中忽略了语义上重要但能量较弱的组件;ii) 参数空间中任务向量的几何不一致性,导致直接合并扭曲其 underlying 方向几何。为此,我们提出了 DC-Merge 一种方向一致模型合并方法。它首先通过平滑每个任务向量的奇异值来平衡其能量分布,确保所有知识组件都得到充分表示。这些能量平衡后的向量随后投影到共享正交子空间中,以最小重构误差对其方向几何进行对齐。最终,将对齐后的向量在共享正交子空间中聚合,并投影回原始参数空间。在视觉和视觉-语言基准测试上进行的大量实验表明,DC-Merge 在全参数微调和 LoRA 设置下均一致实现了最先进的性能。实现代码已发布于 https://github.com/Tobeginwith/DC-Merge。

关键词

引用

@article{arxiv.2603.06242,
  title  = {DC-Merge: Improving Model Merging with Directional Consistency},
  author = {Han-Chen Zhang and Zi-Hao Zhou and Mao-Lin Luo and Shimin Di and Min-Ling Zhang and Tong Wei},
  journal= {arXiv preprint arXiv:2603.06242},
  year   = {2026}
}

备注

Accepted by CVPR 2026 Main Track