面向视觉语言模型的动态秩自适应
计算机视觉与模式识别
2025-07-09 v1
摘要
预训练的大型视觉语言模型 (VLM) 如 CLIP 显示出惊人的泛化能力。现有的基于 prompt 和 adapter 的方法在 fine-tuning VLM 时取得了显著进展,但仍面临着在面对未见新类别时维持强大泛化能力的挑战。这一限制部分源于这些方法将图像和文本编码器的所有 token 都平等对待,这可能导致对较少信息性特征 (如背景噪声、模板词) 进行过拟合,从而损害对 novel concept 识别至关重要的通用表示。为此,我们提出了 Dynamic Rank Adaptation (DRA),这是一种新的 adapter 变体方法,专为增强 new class 泛化而设计。DRA 在训练期间动态分配 adaptation 秩,这取决于各特征的重要性,以保持通用知识。DRA 首先采用 token importance grouping,使用 sequence attention 对 token 的重要性进行评估并进行分组。随后,我们根据每个 token group 的重要性动态分配适当的特征秩,将更高的特征秩分配给更重要的 token。我们还设计了一种新的 channel response 机制,以优先选择每个实例最具信息性的特征 channel 进行保留和适应。此外,我们引入一个 L1 正则化项以稳定训练。广泛的实验结果表明,我们提出的 DRA 在 various benchmarks 上优于现有方法,尤其在提升 new classes 性能方面尤为有效,包括 base-new classes、cross-datasets 评估和 domain generalization。
引用
@article{arxiv.2507.05668,
title = {Dynamic Rank Adaptation for Vision-Language Models},
author = {Jiahui Wang and Qin Xu and Bo Jiang and Bin Luo},
journal= {arXiv preprint arXiv:2507.05668},
year = {2025}
}