DoRA:权重分解型低秩适配
计算与语言
2024-07-10 v6 计算机视觉与模式识别
摘要
在广泛使用的参数高效微调(PEFT)方法中,LoRA 及其变体因避免额外的推理成本而获得了广泛流行。然而,这些方法与全参数微调(FT)之间仍常存在精度差距。本文首先引入一种新颖的权重分解分析,以探讨FT与LoRA之间固有的差异。针对这些发现,我们提出Weight-Decomposed Low-Rank Adaptation (DoRA)。DoRA 将预训练权重分解为两个分量——幅度和方向,以进行微调,具体地采用LoRA进行方向性更新,从而高效地最小化可训练参数的数量。通过采用\ours,我们既提升了LoRA的学习能力和训练稳定性,又无需增加额外的推理开销。\ours~在对LLaMA、LLaVA和VL-BART进行各种下游任务的微调时(如常识推理、视觉指令调优和图像/视频-文本理解),均一致优于LoRA。代码已公开于 https://github.com/NVlabs/DoRA。
引用
@article{arxiv.2402.09353,
title = {DoRA: Weight-Decomposed Low-Rank Adaptation},
author = {Shih-Yang Liu and Chien-Yi Wang and Hongxu Yin and Pavlo Molchanov and Yu-Chiang Frank Wang and Kwang-Ting Cheng and Min-Hung Chen},
journal= {arXiv preprint arXiv:2402.09353},
year = {2024}
}
备注
ICML2024(Oral)