中文

RegMean++: 改进回归均值方法以提升模型合并的有效性与泛化能力

机器学习 2026-04-28 v3

摘要

回归均值(Regression Mean, RegMean)是一种将模型合并形式化为线性回归问题的 approach,旨在通过最小化合并后模型与候选模型之间预测差异, 来寻找每个线性层的最优权重。RegMean 提供了合并问题的精确闭式解;因此, 它具有可解释性和计算效率。然而, RegMean 将每个线性层独立地进行合并, 忽略了早期层特征和信息如何通过更深层传播并影响合并后模型的最终预测。本文引入 RegMean++, 一种简单而有效的 RegMean 替代方案, 明确地将合并后模型各层之间的内部依赖和跨层依赖纳入 RegMean 的目标函数。通过考虑这些依赖, RegMean++ 更好地捕捉了合并后模型的行为。大量实验表明, 在包括原分布内 (in-domain, ID) 和原分布外 (out-of-domain, OOD) 泛化、顺序合并、大规模任务以及几种分布迁移下的鲁棒性等多种设置下, RegMean++ 均一致优于 RegMean。此外, 与各种先进的模型合并方法相比, RegMean++ 在不同设置下也能实现竞争性性能。

关键词

引用

@article{arxiv.2508.03121,
  title  = {RegMean++: Enhancing Effectiveness and Generalization of Regression Mean for Model Merging},
  author = {The-Hai Nguyen and Dang Huu-Tien and Takeshi Suzuki and Le-Minh Nguyen},
  journal= {arXiv preprint arXiv:2508.03121},
  year   = {2026}
}

备注

Accepted by Transactions on Machine Learning Research