中文

SUMO:用于加速内存高效 LLM 训练的子空间感知矩正交化

机器学习 2025-10-28 v2 计算与语言 最优化与控制

摘要

低秩基于梯度的优化方法显著提升了大型语言模型 (LLMs) 训练期间的内存效率,使其能够在受限硬件上运行而不牺牲性能。然而,这些方法主要强调内存节省,往往忽略了由于依赖标准各向同性最速下降技术而带来的收敛加速潜力,这些技术在深度网络(尤其是 LLMs)典型的高度各向异性景观中表现不佳。在本文中,我们提出了 SUMO (Subspace-Aware Moment-Orthogonalization,子空间感知矩正交化),这是一种在动态适应的低维子空间内采用精确奇异值分解 (SVD) 进行矩正交化的优化器,能够实现范数诱导的最速下降优化步骤。通过将优化步骤与损失景观的谱特性显式对齐,SUMO 有效缓解了与 Newton-Schulz 正交化近似等常用方法相关的近似误差。我们在理论上建立了这些近似误差的上界,证明了它们依赖于矩的条件数,而我们通过解析证明这些条件在 LLM 训练中确实会遇到。此外,我们从理论和经验上证明,通过 SVD 进行的精确正交化能显著提高收敛速度并降低整体复杂度。实证评估证实,与 SOTA 方法相比,SUMO 加速了收敛,增强了稳定性,提升了性能,并将内存需求降低了高达 20%。

关键词

引用

@article{arxiv.2505.24749,
  title  = {SUMO: Subspace-Aware Moment-Orthogonalization for Accelerating Memory-Efficient LLM Training},
  author = {Yehonathan Refael and Guy Smorodinsky and Tom Tirer and Ofir Lindenbaum},
  journal= {arXiv preprint arXiv:2505.24749},
  year   = {2025}
}