面向少样本分类的补充子空间低秩适配视觉语言模型
计算机视觉与模式识别
2025-01-28 v1
摘要
视觉语言模型 (Vision Language Model, VLM) 旨在进行大规模图像-文本对齐,作为预训练的基础模型。对于下游的少样本分类任务,参数高效微调 (Parameter Efficient Fine-tuning, PEFT) VLM 在计算机视觉领域获得了广泛关注。虽然 prompt tuning 和线性适配器等 PEFT 方法已被用于微调 VLM,但低秩适配 (LoRA) 算法在少样本微调 VLM 中鲁atively 被研究。使用 LoRA 进行少样本微调的主要障碍是灾难性遗忘问题。由于视觉语言对齐知识对于少样本学习中的通用性至关重要,而低秩适配会干扰预训练权矩阵最具信息性的方向。我们提出了补充子空间低秩适配 (Complementary Subspace Low-Rank Adaptation, Comp-LoRA) 方法,以正则化少样本 VLM 微调中的灾难性遗忘问题。具体而言,我们在补充子空间中优化低秩矩阵,从而在学习新颖的少样本信息时保留 VLM 的通用视觉语言对齐能力。我们对比评估了所提出的 Comp-LoRA 方法与其他 PEFT 方法在 VLM 少样本分类微调中的性能。我们还展示了所提方法相对于直接将 LoRA 应用于 VLM 在抑制灾难性遗忘方面的效果。结果表明,所提方法相较于基线方法在 Top-1 准确率上提升约 1.0%,并在约 1.3% 的 Top-1 准确率上保留了 VLM 的零样本性能。
引用
@article{arxiv.2501.15040,
title = {Complementary Subspace Low-Rank Adaptation of Vision-Language Models for Few-Shot Classification},
author = {Zhongqi Wang and Jia Dai and Kai Li and Xu Li and Yanmeng Guo and Maosheng Xiang},
journal= {arXiv preprint arXiv:2501.15040},
year = {2025}
}
备注
Preprint version