中文

大语言模型时代的模型合并:方法、应用与未来方向

计算与语言 2026-03-31 v2

摘要

模型合并将多个神经网络的参数组合到单个模型中,无需额外训练。随着微调的大型语言模型(LLMs)不断增多,合并提供了一种计算高效的替代方案,取代集束和完整重新训练,使实践者能够以最小成本组合专门的能力。本次调查通过\textbf{FUSE}分类法考察了LLM时代的模型合并,分类沿\textbf{F}oundations、\textbf{U}nification Strategies、\textbf{S}cenarios和\textbf{E}cosystem展开。我们首先建立模型合并的理论基础,包括损失景观几何和模式可达性,然后系统性地审阅了算法空间,涵盖权重平均、任务向量算术、稀疏化增强方法、混合专家架构和进化优化。我们进一步检查了跨多任务学习、安全对齐、领域专业化和联邦学习的下游应用,并调查了支持生态系统的工具和评估基准。最后,我们确定了关键开放挑战和未来方向,旨在为研究人员和实践者提供一个结构化的基础,推动模型合并的进一步发展。

关键词

引用

@article{arxiv.2603.09938,
  title  = {Model Merging in the Era of Large Language Models: Methods, Applications, and Future Directions},
  author = {Mingyang Song and Mao Zheng},
  journal= {arXiv preprint arXiv:2603.09938},
  year   = {2026}
}