视觉Transformer的串行低秩适应
计算机视觉与模式识别
2025-03-25 v1 多媒体
摘要
在资源受限的应用场景中,以参数高效的方式微调大型预训练视觉基础模型对于下游视觉任务至关重要,考虑到计算和存储成本的实际限制。低秩适应(LoRA)是该领域的成熟技术,通过将参数空间降低为低秩形式实现了显著的效率。然而,开发更先进的低秩适应方法以减少参数和内存需求仍是资源受限场景中的重大挑战。本研究在常用的视觉Transformer之上提出了Serial LoRA,这是一种新的LoRA变体,引入一个共享的低秩矩阵串行组合注意力机制。这种设计提取适应参数中的底层共性,显著减少冗余。值得注意的是,Serial LoRA仅使用LoRA的1/4参数,但在大多数情况下均实现了相当的性能。我们在广泛的视觉基础模型上进行了大量实验,结果证实了我们方法的持久优势。
引用
@article{arxiv.2503.17750,
title = {Serial Low-rank Adaptation of Vision Transformer},
author = {Houqiang Zhong and Shaocheng Shen and Ke Cai and Zhenglong Wu and Jiangchao Yao and Yuan Cheng and Xuefei Li and Xiaoyun Zhang and Li Song and Qiang Hu},
journal= {arXiv preprint arXiv:2503.17750},
year = {2025}
}