中文

LoRA Done RITE:用于 LoRA 优化的鲁棒不变变换平衡

机器学习 2025-07-18 v2 人工智能 计算与语言

摘要

低秩适配是一种广泛用于 LLM 的参数高效微调方法,可降低内存需求。然而,当前的 LoRA 优化器缺乏变换不变性,这意味着对权重的实际更新取决于两个 LoRA 因子的缩放或旋转方式。这一缺陷导致在实践中学习效率低下且解次优。本文引入了 LoRA-RITE,一种用于 LoRA 优化的新型自适应矩阵预条件方法,它能够实现变换不变性并保持计算高效。我们提供了理论分析以证明我们方法的优势,并在包括 Gemma 2B、7B 和 mT5-XXL 在内的不同模型的各种 LLM 任务上进行了实验。结果表明,与现有优化器相比有一致的改进。例如,在 Gemma-2B 的 LoRA 微调期间用 LoRA-RITE 替换 Adam,在 Super-Natural Instructions 上获得了 4.6% 的准确率提升,在其他四个 LLM 基准测试(HellaSwag、ArcChallenge、GSM8K、OpenBookQA)上获得了 3.5% 的准确率提升。

关键词

引用

@article{arxiv.2410.20625,
  title  = {LoRA Done RITE: Robust Invariant Transformation Equilibration for LoRA Optimization},
  author = {Jui-Nan Yen and Si Si and Zhao Meng and Felix Yu and Sai Surya Duvvuri and Inderjit S. Dhillon and Cho-Jui Hsieh and Sanjiv Kumar},
  journal= {arXiv preprint arXiv:2410.20625},
  year   = {2025}
}

备注

Published as an oral paper at ICLR 2025. The code for our project is available at https://github.com/gkevinyen5418/LoRA-RITE