中文

Souper-Model:简单算术如何解锁大语言模型的性能提升

计算与语言 2025-11-18 v1

摘要

大型语言模型(LLM)在各个领域展现出惊人的能力,但其训练仍需巨大的计算资源和时间代价,需要大规模的计算力量并谨慎地协调训练程序。模型汤化(model souping)——即对多个相同架构模型的权重进行平均——已然然为一种有前景的训练前后技术,可在不昂贵地重新训练的情况下提升性能。在本文中,我们引入一种名为 "Soup Of Category Experts(SoCE)" 的方法,利用基准组成识别最佳模型候选,并应用非均匀加权平均以最大化性能。与以往的均匀平均方法不同,我们的方法利用了基准类别在模型性能上往往表现出低相关性的观察。SoCE 为每个弱相关类别聚类识别 "专家" 模型,并使用优化后的加权平均而非均匀权重进行组合。我们展示,所提方法在多个领域均能提升性能和鲁棒性,包括多语言能力、工具调用和数学,并在伯克利函数调用排行榜上取得最先进结果。

关键词

引用

@article{arxiv.2511.13254,
  title  = {Souper-Model: How Simple Arithmetic Unlocks State-of-the-Art LLM Performance},
  author = {Shalini Maiti and Amar Budhiraja and Bhavul Gauri and Gaurav Chaurasia and Anton Protopopov and Alexis Audran-Reiss and Michael Slater and Despoina Magka and Tatiana Shavrina and Roberta Raileanu and Yoram Bachrach},
  journal= {arXiv preprint arXiv:2511.13254},
  year   = {2025}
}