单头八臂:基于块矩阵的 CLIP 基于少量样本学习低秩适配
计算机视觉与模式识别
2025-01-29 v1 人工智能
摘要
最近的一些在微调视觉语言基础模型(Vision-Language Foundation Models, VLMs)方面的进展在下游少量样本学习任务中引起了广泛关注。虽然这些最近的做法在性能上有所提升,但往往 suffer于训练参数过多和高计算成本。为此,我们提出了一种新的基于块矩阵的低秩适配框架,称为 Block-LoRA,用于在下游少量样本任务上微调 VLMs。灵感来自最近关于低秩适配(LoRA)的工作,Block-LoRA 将原始低秩分解矩阵划分为一系列子矩阵,同时共享所有下投影子矩阵。这种结构不仅减少了训练参数的数量,而且将某些复杂的矩阵乘法运算转换为更简单的数组运算,显著降低了微调的计算成本。值得注意的是,Block-LoRA 能够在单块 24GB GPU 上对 ImageNet 少量样本基准进行微调。我们还展示了 Block-LoRA 比 vanilla LoRA 更紧密的泛化误差界。没有华丽的装饰,广泛的实验表明,Block-LoRA 在保持低训练参数数量和降低计算开销的同时,在竞争性地与最先进的 CLIP 基于少量样本方法的性能相当。
关键词
引用
@article{arxiv.2501.16720,
title = {One Head Eight Arms: Block Matrix based Low Rank Adaptation for CLIP-based Few-Shot Learning},
author = {Chunpeng Zhou and Qianqian Shen and Zhi Yu and Jiajun Bu and Haishuai Wang},
journal= {arXiv preprint arXiv:2501.16720},
year = {2025}
}
备注
Under Review