通过谱修剪提升大语言模型训练
机器学习
2026-05-29 v2 最优化与控制
摘要
谱基优化器如Muon直接作用于更新的谱结构,而标准自适应方法如AdamW未考虑权重与梯度的谱结构,易受大语言模型(LLM)训练中两类经验问题的困扰:(i)优化器更新可能具有较大的谱范数,导致训练不稳定并损害泛化;(ii)随机梯度噪声可能呈现稀疏谱尖峰,仅少数主导奇异值远大于其余部分。我们提出SPECTRA框架,通过(i)后谱修剪更新以强制执行谱范数约束(ii)可选的前谱修剪梯度以抑制稀疏谱尖峰。我们证明,后修剪构为带谱范数约束和权重正则化的复合Frank-Wolfe方法。进一步分析前修剪如何缓解稀疏谱尖峰。我们提出通过Newton-Schulz迭代实现高效软谱修剪,避免昂贵的奇异值分解。在LLM预训练实验中,SPECTRA在各种优化器上均显著改善验证损失,最佳变体实现了最先进的效果。采用SPECTRA训练的模型表现出较小的权重范数,印证了谱修剪与正则化之间的关联。
引用
@article{arxiv.2603.14315,
title = {Enhancing LLM Training via Spectral Clipping},
author = {Xiaowen Jiang and Andrei Semenov and Sebastian U. Stich},
journal= {arXiv preprint arXiv:2603.14315},
year = {2026}
}
备注
v2: ICML 2026