GaLore$+$:通过跨头投影提升低秩适配大语言模型的性能
计算与语言
2024-12-31 v1 人工智能
机器学习
摘要
近期的低秩训练方法,如 GaLore,显著降低了优化大语言模型 (LLMs) 所需的内存。然而,这些方法常因低秩投影估计耗时而受限。特别是 GaLore 中的奇异值分解 (SVD) 可占总训练时间的 80%以上。为此,我们提出 GaLore,采用跨头低秩投影以减少为多头注意力估计低秩投影的巨大时间消耗。此外,我们采用随机子空间迭代实现快速 SVD。为进一步提升性能,我们提出稀疏编码残差,以减少低秩近似对优化器和权重更新的一阶、二阶矩造成的误差。我们在算术推理和自然语言生成数据集上评估了 GaLore。实验结果表明,GaLore 在保持约 速度提升的同时,实现了优于 vanilla GaLore 的卓越性能。
引用
@article{arxiv.2412.19820,
title = {GaLore$+$: Boosting Low-Rank Adaptation for LLMs with Cross-Head Projection},
author = {Xutao Liao and Shaohui Li and Yuhui Xu and Zhi Li and Yu Liu and You He},
journal= {arXiv preprint arXiv:2412.19820},
year = {2024}
}