HRP:用于更优 LoRA 初始化的高秩预热
机器学习
2025-05-27 v3
摘要
本文研究了初始化在低秩微调 (LoRA) 中的关键影响。通过理论分析,我们证明了 LoRA 的微调结果对初始化高度敏感,这很可能导致次优的低秩结果。虽然可以通过将初始方向调整至目标 的主奇异向量来缓解这一问题,但在实际场景中这通常是未知的。为了近似这一初始方向,我们提出了高秩预热 (HRP),它首先以更高的预热秩训练 LoRA 几步,然后使用推导出的 的主奇异向量作为主要微调过程的初始化。仅通过初始方向的修改,我们证明了 HRP 能使 LoRA 在期望上取得比随机初始化更好的微调结果,且这种增强效果随预热秩的增加而提升。我们通过各种模型和任务中的广泛实验验证了我们的理论发现,其中 HRP 显著增强了 LoRA 的有效性,并优于其他初始化策略和其他 LoRA 变体。
引用
@article{arxiv.2502.07739,
title = {HRP: High-Rank Preheating for Superior LoRA Initialization},
author = {Yuzhu Chen and Yingjie Wang and Shi Fu and Li Shen and Yongcheng Jing and Xinmei Tian and Dacheng Tao},
journal= {arXiv preprint arXiv:2502.07739},
year = {2025}
}