中文

用于参数高效微调的低秩注意力侧边微调

计算机视觉与模式识别 2024-02-07 v1 人工智能

摘要

在将大型预训练模型微调到下游任务时,参数高效微调(PEFT)方法可以用少量可训练参数有效地微调预训练模型,但存在 GPU 显存消耗高和训练速度慢的问题。由于这些方法中的可学习参数与预训练模型纠缠在一起,在微调过程中必须计算并存储与冻结预训练模型参数相关的梯度。我们提出了低秩注意力侧边微调(LAST),通过不仅冻结参数而且冻结预训练网络的输出,将可训练模块与预训练模型解耦。LAST 训练一个仅由低秩自注意力模块组成的侧边网络。通过将预训练模型视为冻结的特征提取器,侧边网络接收预训练模型的中间输出并专注于学习任务特定知识。我们还表明,LAST 可以在多个优化目标上高度并行化,使其在下游任务适配(例如寻找最优超参数)中非常高效。LAST 在 VTAB-1K 和其他视觉适配任务上优于以前的最先进方法,其 GPU 显存占用仅为现有 PEFT 方法的约 30%,训练时间仅为 60%,同时实现了显著更高的准确率。

关键词

引用

@article{arxiv.2402.04009,
  title  = {Low-rank Attention Side-Tuning for Parameter-Efficient Fine-Tuning},
  author = {Ningyuan Tang and Minghao Fu and Ke Zhu and Jianxin Wu},
  journal= {arXiv preprint arXiv:2402.04009},
  year   = {2024}
}