One-for-All:用于参数高效微调的广义LoRA
机器学习
2023-10-17 v2 人工智能
计算机视觉与模式识别
摘要
我们提出广义LoRA(GLoRA),一种面向通用参数高效微调任务的高级方法。在Low-Rank Adaptation(LoRA)的基础上,GLoRA采用广义提示模块来优化预训练模型权重并调整中间激活,从而在多样化任务与数据集上提供更高的灵活性与能力。此外,GLoRA通过可扩展的、模块化的逐层结构搜索来学习每层的独立适配器,从而实现高效的参数适配。源于统一的数学表述,GLoRA展现出强大的迁移学习、少样本学习与域泛化能力,因为它不仅通过权重而且通过激活等额外维度来适应新任务。综合实验表明,GLoRA在自然、专业与结构化视觉基准上均优于以往所有方法,以更少的参数与计算量取得更优精度。所提方法在LLaMA-1与LLaMA-2上相较原始LoRA在语言领域也显示出可观提升。此外,我们的结构重参数化设计确保GLoRA不带来额外推理开销,使其成为资源受限场景下的实用方案。代码与模型见:https://github.com/Arnav0400/ViT-Slim/tree/master/GLoRA。
引用
@article{arxiv.2306.07967,
title = {One-for-All: Generalized LoRA for Parameter-Efficient Fine-tuning},
author = {Arnav Chavan and Zhuang Liu and Deepak Gupta and Eric Xing and Zhiqiang Shen},
journal= {arXiv preprint arXiv:2306.07967},
year = {2023}
}
备注
Technical report. v2: Add LLaMA-1&2 results. Code and models at https://github.com/Arnav0400/ViT-Slim/tree/master/GLoRA