GaLore 2:基于梯度低秩投影的大规模 LLM 预训练
机器学习
2025-04-30 v1 人工智能
摘要
大语言模型(LLMs)已彻底变革自然语言理解和生成,但在训练过程中面临显著的内存瓶颈。GaLore(Gradient Low-Rank Projection)通过利用权重梯度的固有低秩结构,实现了显著的内存节省,同时不牺牲性能。近期研究进一步从多个方面扩展了GaLore,包括低位量化和更高阶张量结构。然而,GaLore仍面临若干挑战,如基于子空间更新的SVD计算开销,以及与最新训练并行化策略(如FSDP)的集成。在本文中,我们提出GaLore 2,这是一个高效且可扩展的GaLore框架,旨�解决这些挑战并吸纳最新进展。此外,我们通过使用最高达5000亿训练标记对Llama 7B进行从头预训练,展示了GaLore 2的可扩展性,凸显了其在实际LLM预训练场景中的潜在影响。
引用
@article{arxiv.2504.20437,
title = {GaLore 2: Large-Scale LLM Pre-Training by Gradient Low-Rank Projection},
author = {DiJia Su and Andrew Gu and Jane Xu and Yuandong Tian and Jiawei Zhao},
journal= {arXiv preprint arXiv:2504.20437},
year = {2025}
}