SwitchLoRA: switched低秩适配技术可学习全秩信息
摘要
在大型语言模型的训练中,参数高效技术如LoRA优化了内存使用,减少了微调阶段的通信开销和内存占用。然而,在预训练阶段直接应用此类技术会导致性能不佳,主要原因是过早实施低秩训练显著降低了模型准确率。现有方法如ReLoRA和GaLore尝试通过更新低秩子空间来解决此挑战,但仍未能达到全秩训练的准确率。具体而言,ReLoRA通过限制更新频率来保持优化器状态一致性,这限制了其贴近模拟全秩训练行为的能力。而GaLore依赖奇异值分解(SVD)来逼近全秩空间,引入了近似过程中的精度损失。本文引入SwitchLoRA,这是一种参数高效训练技术,通过频繁且平滑地替换LoRA适配器的可训练参数为替代参数。SwitchLoRA逐步更新低秩子空间,仅针对少数维度,以最小化对优化器状态的影响。这使得更新频率更高,从而通过使更新后的参数在预训练阶段更贴近全秩行为来提升准确率。我们的实验结果表明,SwitchLoRA实际上超越了全秩训练,在LLaMA 1.3B模型上将困惑度从15.23降至15.01,同时将通信开销降低54%,内存使用降低13%。此外,在GLUE基准测试上对SwitchLoRA预训练模型和全秩预训练模型进行完全微调后,SwitchLoRA预训练模型在全秩预训练模型上的平均准确率提升约1%。
引用
@article{arxiv.2406.06564,
title = {SwitchLoRA: Switched Low-Rank Adaptation Can Learn Full-Rank Information},
author = {Kaiye Zhou and Shucheng Wang and Jun Xu},
journal= {arXiv preprint arXiv:2406.06564},
year = {2025}
}
备注
SwitchLoRA introduces an innovative parameter-efficient training method that dynamically switches parameters throughout the entire training period, achieving significant memory and communication overhead while preserving accuracy