中文

OP-LoRA:维度的祝福

机器学习 2024-12-16 v1 计算机视觉与模式识别

摘要

低秩适配器通过仅使用少量参数来实现大模型的微调,从而降低存储成本并降低灾难性遗忘风险。然而,这些方法常面临优化挑战,收敛性差。为克服这些困难,我们引入一种超参数化方法,在不增加推理成本的前提下加速训练。该方法通过为每一层采用独立的 MLP 和学习嵌入来重新参数化低秩适配器。学习嵌入输入至 MLP 中,后者生成适配器参数。此类超参数化已被证明可隐式充当自适应学习率和动量,加速优化。在推理阶段,MLP 可被丢弃,仅保留标准低秩适配器。为研究 MLP 超参数化对小规模但困难代理任务的影响,我们在矩阵分解上实现了该方法,发现其可实现更快的收敛速度并获得更低的最终损失。将该方法扩展至更大规模任务,我们观察到跨领域的持续性能提升。在视觉-语言任务中取得改进,尤其在图像生成任务中表现显著,CMMD 分数提升最高可达 15 分。

关键词

引用

@article{arxiv.2412.10362,
  title  = {OP-LoRA: The Blessing of Dimensionality},
  author = {Piotr Teterwak and Kate Saenko and Bryan A. Plummer and Ser-Nam Lim},
  journal= {arXiv preprint arXiv:2412.10362},
  year   = {2024}
}