Natural GaLore:用于内存高效LLM训练与微调的加速方法
机器学习
2024-10-22 v1 多智能体系统
摘要
LLM训练因数据、权重和优化器状态的不断增大,面临着显著的内存挑战。数据并行、模型并行、梯度检查点和卸载策略等技术虽能缓解此问题,但常因硬件限制而难以实现。为减轻内存使用,替代方法如参数高效微调(PEFT)和GaLore对权重或优化器状态进行近似。PEFT方法如LoRA因其在微调LLM方面的流行,虽需完整秩初始化。相比之下,GaLore允许在保持更低内存开销的同时进行完整参数学习。本工作引入Natural GaLore,这是一种可作为AdamW简单替换的实现,利用沃木巷式身份矩阵高效地将逆经验Fisher信息矩阵应用于低秩梯度。我们展示,纳入二阶信息的优化在迭代预算有限时显著加速。在C4数据上对60M、130M、350M和1.1B参数的Llama模型进行经验预训练,表明在无额外内存开销的情况下,Natural GaLore相较于GaLore在困惑度上显著更低。通过在GLUE基准上对RoBERTa进行微调,我们证明了Natural GaLore在与完全微调相比,差距缩小了86.05% vs 86.28%。此外,对TinyLlama 1.1B模型在TinyAgent框架下进行功能调用微调,表明Natural GaLore在TinyAgent数据集上达到83.09%的准确率,显著优于16位LoRA的80.06%,甚至超过GPT4-Turbo的4%,同时仅使用30%的内存。所有复现结果的代码均可用:https://github.com/selfsupervised-ai/Natural-GaLore.git
引用
@article{arxiv.2410.16029,
title = {Natural GaLore: Accelerating GaLore for memory-efficient LLM Training and Fine-tuning},
author = {Arijit Das},
journal= {arXiv preprint arXiv:2410.16029},
year = {2024}
}
备注
10 pages, 3 tables, 3 figures