MMRL++:面向视觉语言模型的参数高效与交互感知表示学习
计算机视觉与模式识别
2025-05-16 v1
摘要
大规模预训练的视觉语言模型(VLMs)已在跨领域任务中显著推进了迁移学习。然而,在有限少样本数据下对这些模型进行适配往往导致过拟合,削弱其泛化到新任务的能力。为此,我们提出了多模态表示学习(MMRL),它引入了一个共享的、可学习的、模态无关的表示空间。MMRL 生成空间令牌,将其投影到文本和图像编码器中作为表示令牌,从而实现更有效的跨模态交互。与主要优化类令牌特征的先前方法不同,MMRL 将表示令牌插入更高的编码器层——其中任务特定特征更为突出——同时在较低层中保留通用知识。在训练过程中,类特征和表示特征联合优化:表示令牌上应用可训练的投影层进行任务适配,而类令牌的投影层保持冻结以保留预训练知识。为进一步促进泛化,我们引入了一项正则化项,使类特征和文本特征与冻结 VLM 的零样本特征对齐。在推理时,解耦策略在基础任务中同时使用类特征和表示特征,但由于表示特征的更强泛化能力,在新任务中仅使用类特征。在此基础上,我们提出了 MMRL++,一种参数高效且交互感知的扩展,显著减少了可训练参数并增强了模态内交互——特别是在表示令牌各层之间——允许梯度共享和实例特定信息更有效地在网络中传播。在 15 个数据集上的广泛实验表明,MMRL 和 MMRL++ 一致优于最先进方法,在任务特定适配和泛化之间实现了强有力的平衡。
引用
@article{arxiv.2505.10088,
title = {MMRL++: Parameter-Efficient and Interaction-Aware Representation Learning for Vision-Language Models},
author = {Yuncheng Guo and Xiaodong Gu},
journal= {arXiv preprint arXiv:2505.10088},
year = {2025}
}
备注
Due to the limitation "The abstract field cannot be longer than 1,920 characters", the abstract appearing here is slightly shorter than that in the PDF file