语言模型预训练中模型合并的秩-1 子空间追踪
机器学习
2026-05-27 v1
摘要
模型合并已成为增强大型语言模型 (LLMs) 的轻量级范式,但其背后的机制仍鲜为人知。本工作分析了后期预训练轨迹,发现一种 \textbf{秩-1 子空间} 现象:尽管原始优化步骤剧烈振荡,连续的 \emph{合并} 检查点却坍缩到一个稳定的、约为一维的线性流形上。我们在 \emph{河谷} landscapes 分析中对此观察进行理论阐释:平均化作为几何低通滤波器,抑制高曲率噪声以揭示最优下降方向。借此洞见,我们提出 \textbf{Extra-Merge},一种无需额外梯度更新即可沿该子空间外推以最小化损失的训练-free 策略。广泛实验在 GPT-2 和 LLaMA 系列 (1.24 亿至 20 亿参数) 上表明,Extra-Merge 持续优于标准合并基线。值得注意的是,它在 Pythia-12B 下游任务上实现持续的零样本准确率提升,并能有效地推广到 Muon 优化器 \citep{jordan2024muon}。
引用
@article{arxiv.2605.26484,
title = {Extra-Merge: Tracing the Rank-1 Subspace of Model Merging in Language Model Pre-Training},
author = {Wenjie Zhou and Bohan Wang and Hongtao Zhang and Chenxi Jia and Wei Chen and Xueqi Cheng},
journal= {arXiv preprint arXiv:2605.26484},
year = {2026}
}