面向视觉语言模型的多样性协方差感知提示学习
计算机视觉与模式识别
2025-03-04 v1
摘要
提示调谐可以进一步提升视觉语言模型在各种下游任务(如少样本学习)上的性能,使其能够更好地适应特定应用程序和需求。在本文中,我们提出了一种多样性协方差感知框架,从数据中学习分布信息,以增强提示模型的少样本能力。首先,我们提出了一种协方差感知方法,通过建模视觉特征之间的协方差关系,并使用不亚于余弦距离的各向异性马哈拉诺距离来衡量两个模态之间的相似度。我们对该建模过程进行严格的推导与证明。然后,我们提出了多样性感知方法,学习多个多样化的软提示以捕获类别的不同属性,并独立地与视觉模态对齐。该方法实现了多中心协方差建模,形成更具多样性的决策边界。广泛的实验在11个数据集上的各种任务中证明了本方法的有效性。
引用
@article{arxiv.2503.01531,
title = {Diversity Covariance-Aware Prompt Learning for Vision-Language Models},
author = {Songlin Dong and Zhengdong Zhou and Chenhao Ding and Xinyuan Gao and Alex Kot and Yihong Gong},
journal= {arXiv preprint arXiv:2503.01531},
year = {2025}
}