Spectra:针对谱特征各向异性的 LLM 优化器
机器学习
2026-02-13 v1 人工智能
摘要
LLM 训练中的梯度信号高度各向异性: recurrent 语言结构将能量浓缩到小集合的主导谱方向,而上下文特定信息则分布在长尾区域。我们发现,这种尖峰-尾部分离在训练过程中持续存在,其中尖峰仅占约 1.5% 的方向,但主导优化器统计。这种主导地位通过二阶矩归一化收缩尾部更新,进而紧缩全局稳定学习率上界,抑制尾部学习。基于此分析,我们提出了 Spectra,一种感知尖峰的优化器,通过抑制主导低秩尖峰子空间而不放大噪声敏感的谱尾。Spectra 通过缓存、热启动的幂迭代跟踪尖峰子空间,并以可忽略的开销和显著降低的优化器状态内存实现低秩谱塑形。在训练 500 亿 token 的 LLaMA3 8B 上,Spectra 比 AdamW 快 30% 达到相同目标损失,端到端开销降低 0.7%,优化器状态内存降低 49.25%,并提升下游平均准确率 1.62%。相较于 Muon,Spectra 在优化器处理时间上快 5.1 倍,最终损失更低,平均准确率提升 0.66%。
引用
@article{arxiv.2602.11185,
title = {Spectra: Rethinking Optimizers for LLMs Under Spectral Anisotropy},
author = {Zhendong Huang and Hengjie Cao and Fang Dong and Ruijun Huang and Mengyi Chen and Yifeng Yang and Xin Zhang and Anrui Chen and Mingzhi Dong and Yujiang Wang and Jinlong Hou and Qin Lv and Robert P. Dick and Yuan Cheng and Fan Yang and Tun Lu and Li Shang},
journal= {arXiv preprint arXiv:2602.11185},
year = {2026}
}