基于更新近似的极端高效低秩微调初始化策略
计算与语言
2025-10-03 v4 人工智能
机器学习
摘要
低秩适配器已成为高效微调大型语言模型的标准方法,但常常未能达到完整微调的性能。我们提出一种方法 LoRA Silver Bullet 或 LoRA-SB,通过精心设计的初始化策略,对低秩子空间内的完整微调进行近似。我们理论性地展示,LoRA-XS 的架构——即在 B 和 A 之间插入一个可学习的 矩阵而保持其他矩阵固定——提供了此种近似所需的精确条件。我们利用其受限的更新空间,在保持高秩梯度更新最优比例的同时,消除对缩放因子调谐的需求。我们证明,所提初始化提供了初始梯度的最优低秩近似,并在整个训练期间保持更新方向。广泛的实验在数学推理、常识推理和语言理解任务上表明,我们的方法在使用 27-90 倍更少的可学习参数的情况下,超过 LoRA(及基线方法),并综合优于 LoRA-XS。我们的发现表明,在低秩子空间中模拟完整微调是可能的,且在不牺牲性能的情况下实现了显著的参数效率提升。我们的代码已公开:https://github.com/CERT-Lab/lora-sb。
引用
@article{arxiv.2411.19557,
title = {Initialization using Update Approximation is a Silver Bullet for Extremely Efficient Low-Rank Fine-Tuning},
author = {Kaustubh Ponkshe and Raghav Singhal and Eduard Gorbunov and Alexey Tumanov and Samuel Horvath and Praneeth Vepakomma},
journal= {arXiv preprint arXiv:2411.19557},
year = {2025}
}
备注
Kaustubh Ponkshe and Raghav Singhal contributed equally to this work