Weight Scope Alignment:一种令人沮丧的简单方法用于模型合并
人工智能
2024-08-23 v1 机器学习
摘要
在某些应用程序中考虑模型效率和鲁棒性时,合并模型成为基本程序。训练随机性或非独立同分布(Non-I.I.D)数据对基于平均的模型融合构成巨大挑战。以往的研究工作集中在元素级正则化或神经置换以增强模型平均,却忽略了不同模型之间权重范围变化,这会显著影响合并效果。本文揭示了在不同训练条件下权重范围的变化,为模型合并的影响提供了启发。幸运的是,各图层的参数基本遵循高斯分布,这启发我们提出一种 novel 且简单的方法,称为 Weight Scope Alignment(WSA)。它包含两个关键组件:1) 利用目标权重范围指导模型训练过程,以确保后续模型合并中的权重范围匹配。2) 将两个或多个模型的权重范围融合为统一的权重范围,以实现多阶段模型融合。我们将 WSA 正则化扩展到两种不同场景,包括 Mode Connectivity 和 Federated Learning。大量实验研究验证了该方法的有效性。
引用
@article{arxiv.2408.12237,
title = {Weight Scope Alignment: A Frustratingly Easy Method for Model Merging},
author = {Yichu Xu and Xin-Chun Li and Le Gan and De-Chuan Zhan},
journal= {arXiv preprint arXiv:2408.12237},
year = {2024}
}