无偏梯度低秩投影
机器学习
2025-10-21 v1 人工智能
最优化与控制
摘要
内存高效优化是训练日益增大的大型语言模型(LLMs)的关键。流行策略包括梯度低秩投影,仅存储投影后的优化器状态,其中GaLore是典型代表。然而,许多此类方法都存在显著缺点:缺乏收敛保证,因为各种低秩投影方法相对于原始优化算法引入内在偏差,这导致与全参数训练相比存在性能差距。为解决这一问题,本文研究了用于消除低秩投影机制偏差的层级抽样技术。特别是,该方法范式的一个实例催生了一种新型无偏低秩优化方法,基于GaLore的机制和Muon算法,命名为GaLore Unbiased with Muon(GUM)。我们理论上证明了该方法匹配基础Muon算法的收敛保证,同时保持低秩技术的内存效率。实验在LLM微调和预训练中也显示出对GaLore乃至全参数训练更好的非平凡性能提升。进一步的研究表明,这一技术的改进来源于知识在各层内更均匀的分布,导致更高效地利用模型参数空间并实现更好的记忆。
引用
@article{arxiv.2510.17802,
title = {Unbiased Gradient Low-Rank Projection},
author = {Rui Pan and Yang Luo and Yuxing Liu and Yang You and Tong Zhang},
journal= {arXiv preprint arXiv:2510.17802},
year = {2025}
}