揭示大型语言模型中的盆地状损失景观
机器学习
2026-03-17 v3
摘要
我们发现了大型语言模型损失景观中盆地(basins)的涌现。随着模型规模的增大,LLMs对参数空间中的随机扰动变得越来越有韧性,从而产生了广阔的稳定区域,在这些区域内模型表现出几乎相同的性能,但在这些区域之外其能力会崩溃。我们观察到预训练创建了一个基础能力盆地,而随后的对齐微调形成了特定能力盆地(例如安全性、数学、编码)。因此,我们认为在盆地内进行的良性微调应能保留先前能力。此外,我们还分析了最坏情况方向的损失景观,该方向始终陡峭且有害。我们发现对抗性微调沿着几乎最坏情况的方向移动,从而迅速降低模型能力。最后,我们提供了一个理论分析,证明盆地大小界定了任何微调(包括对抗性微调)的性能退化,同时保证了模型对输入扰动的鲁棒性,这表明扩大盆地的益处。
引用
@article{arxiv.2505.17646,
title = {Unveiling the Basin-Like Loss Landscape in Large Language Models},
author = {Huanran Chen and Yinpeng Dong and Zeming Wei and Yao Huang and Yichi Zhang and Hang Su and Jun Zhu},
journal= {arXiv preprint arXiv:2505.17646},
year = {2026}
}