大语言模型中的模型合并缩放定律
人工智能
2026-05-12 v4
摘要
我们研究了以交叉熵衡量的语言模型合并的经验缩放定律。尽管合并在实践中被广泛使用,但缺乏一个定量规则来预测当我们增加专家数量或扩大模型规模时的收益。我们确定了一个紧凑的幂律,将模型规模和专家数量联系起来:尺寸依赖的下界随模型容量减小,而合并尾部在专家数量增加时表现出明显的递减收益。该定律在域内和跨域均成立,紧密拟合了不同架构和方法(Average、TA、TIES、DARE)下的测量曲线,并解释了两个稳健规律:大部分收益在早期获得,且随着更多专家的加入变异性缩小。基于此,我们提出了一个简单理论来解释为什么收益大致按 1/k 下降,并将下界和尾部与基模型的性质和跨域多样性联系起来。该定律使得预测性规划成为可能:估计达到目标损失所需的专家数量,决定何时停止增加专家,并在固定预算下权衡扩大基模型与增加专家——将合并从启发式实践转变为计算高效、可规划的替代方案,取代多任务训练。这暗示了分布式生成AI的缩放原则:通过组合专家实现可预测的收益,为AGI级系统提供了一条互补路径。
引用
@article{arxiv.2509.24244,
title = {Model Merging Scaling Laws in Large Language Models},
author = {Yuanyi Wang and Yanggan Gu and Yiming Zhang and Qi Zhou and Zhaoyi Yan and Congkai Xie and Xinyao Wang and Jianbo Yuan and Hongxia Yang},
journal= {arXiv preprint arXiv:2509.24244},
year = {2026}
}
备注
ICML 2026