中文

DyLoRA:基于动态无搜索低秩适配的预训练模型参数高效微调

计算与语言 2023-04-20 v2 机器学习

摘要

随着预训练模型(PM)规模不断增长,对其微调变得愈发昂贵且耗费资源。作为应对,低秩适配器(LoRA)保持模型主预训练权重冻结,仅向模型中引入一些可学习的截断 SVD 模块(即所谓 LoRA 块)。尽管 LoRA 块参数高效,却存在两个主要问题:其一,这些块的大小固定,训练后无法修改(例如,若需改变 LoRA 块的秩,则必须从头重新训练);其二,优化其秩需要穷举搜索与大量精力。本工作中,我们引入一种动态低秩适配(DyLoRA)技术,一并解决这两个问题。我们的 DyLoRA 方法通过在训练期间对不同秩下适配器模块所学表征进行排序,为一系列秩而非单一秩训练 LoRA 块。我们使用 RoBERTa 与 GPT 等不同规模的预训练模型,在不同自然语言理解(GLUE 基准)与语言生成任务(E2E、DART 和 WebNLG)上评估了我们的方案。结果表明,使用 DyLoRA 训练动态无搜索模型比 LoRA 至少快 4 至 7 倍(取决于任务),且性能无显著损失。此外,与 LoRA 相比,我们的模型在更大得多的秩范围内均能保持一致的良好表现。

关键词

引用

@article{arxiv.2210.07558,
  title  = {DyLoRA: Parameter Efficient Tuning of Pre-trained Models using Dynamic Search-Free Low-Rank Adaptation},
  author = {Mojtaba Valipour and Mehdi Rezagholizadeh and Ivan Kobyzev and Ali Ghodsi},
  journal= {arXiv preprint arXiv:2210.07558},
  year   = {2023}
}

备注

Accepted to EACL 2023