LoR-VP:用于高效视觉模型适应的低秩视觉提示
计算机视觉与模式识别
2025-04-15 v3
摘要
视觉提示作为一种将预训练模型适应于特定任务的方法,特别是在参数高效微调领域,已广受欢迎。然而,现有的视觉提示技术通常将提示参数填充在图像周围,限制了视觉提示与原始图像之间的交互仅限于一小部分图像块,同时忽略了不同图像块之间共享信息中存在的归纳偏置。在本研究中,我们进行了全面的初步调查,以识别并解决这些局限性。我们提出了一种新颖的视觉提示设计,引入了用于视觉提示的低秩矩阵乘法(LoR-VP),它能够在图像像素的行和列之间实现共享和特定于图像块的信息。在七个网络架构和四个数据集上的大量实验表明,与最先进的视觉提示方法相比,LoR-VP 在性能和效率上均有显著提升,训练速度最高提升 6 倍,使用的视觉提示参数减少 18 倍,性能提升 3.1%。代码已开源:https://github.com/jincan333/LoR-VP。
引用
@article{arxiv.2502.00896,
title = {LoR-VP: Low-Rank Visual Prompting for Efficient Vision Model Adaptation},
author = {Can Jin and Ying Li and Mingyu Zhao and Shiyu Zhao and Zhenting Wang and Xiaoxiao He and Ligong Han and Tong Che and Dimitris N. Metaxas},
journal= {arXiv preprint arXiv:2502.00896},
year = {2025}
}