通过合并链重新思考逐层模型合并
机器学习
2026-02-26 v3
摘要
微调预训练模型已成为在广泛领域实现 SOTA 性能的标准途径,导致了大量特定任务模型变体的产生。随着此类专用模型数量的增加,在不重新训练的情况下将它们合并为一个统一模型已成为一项关键挑战。现有的合并技术在单个层级别操作,从而忽略了深度网络中固有的层间依赖性。我们表明,这种简化会导致分布失配,特别是在依赖中间激活的方法中,因为早期层的变化在合并期间未能正确传播到下游层。我们将这些失配确定为内部协变量偏移的一种形式,类似于神经网络训练初始阶段遇到的现象。为了解决这个问题,我们提出了合并链,一种逐层合并程序,在跨层顺序合并权重的同时顺序更新激活统计量。通过显式考虑层间相互作用,CoM 减轻了协变量偏移,并通过一系列条件最优更新生成了连贯的合并模型。在标准基准上的实验表明,CoM 实现了 SOTA 性能。
引用
@article{arxiv.2508.21421,
title = {Rethinking Layer-wise Model Merging through Chain of Merges},
author = {Pietro Buzzega and Riccardo Salami and Angelo Porrello and Simone Calderara},
journal= {arXiv preprint arXiv:2508.21421},
year = {2026}
}