中文

AdaPreLoRA:Adafactor 预条件化低秩适配

机器学习 2026-05-12 v1 人工智能 计算与语言

摘要

低秩适配(LoRA)将权重更新重新参数化为两个低秩因子的乘积,但生成器将这些因子映射到权矩阵的雅可比 JGJ_{G} 是秩不足的,因此任何 W{W}-空间预条件器 Ft{F}_t 诱导的因子空间预条件器 JGFtJGJ_{G}^* {F}_t J_{G} 是奇异的,常规链式法则无法唯一地将预条件化 W{W}-空间方向映射回因子空间更新。我们将现有的 LoRA 优化器在由两个选择参数化的统一框架中:(i) 选择哪种 JGFtJGJ_{G}^* {F}_t J_{G} 的可逆替代方案,以及(ii) 选择 Ft{F}_tW{W} 上的形式。现有方法在这两个轴向上占据四个家族:因子空间自适应更新、JGJGJ_{G}^* J_{G} 的块对角替代方案、Frobenius 残差伪逆方法,以及黎曼流形约束。在此设计空间中,基于梯度统计的 Ft{F}_t 配合 O((m+n)r){O}((m+n)r) 内存的闭形式因子空间求解仍较为探索。我们提出\textbf{AdaPreLoRA},通过在 W{W} 上采用 Adafactor 对角 Kronecker 预条件器 Ht{H}_t,并从结果因子空间解族中选择最小化 Ht{H}_t 加权因子贡献不平衡的元素;按此构建,所得因子更新是对预条件化 W{W}-空间方向在 Ht{H}_t 加权范数下的最近 LoRA 近似。跨 GPT-2 (E2E)、Mistral-7B 和 Qwen2-7B (GLUE、ARC、GSM8K),以及扩散模型个性化,AdaPreLoRA 在保持峰值 GPU 内存处于 LoRA 优化器水平的同时,与代表性 LoRA 优化器集中或改进。

关键词

引用

@article{arxiv.2605.08734,
  title  = {AdaPreLoRA: Adafactor Preconditioned Low-Rank Adaptation},
  author = {Ziyun Liu and Fengmiao Bian and Jian-Feng Cai},
  journal= {arXiv preprint arXiv:2605.08734},
  year   = {2026}
}

备注

27 pages