面向视觉 - 语言模型的多模态属性提示
计算机视觉与模式识别
2024-07-12 v3
摘要
预训练的视觉 - 语言模型(VLMs),如 CLIP,在下游任务中表现出强大的泛化能力,但在少样本场景中表现不佳。现有的提示技术主要关注全局文本和图像表示,却忽略了多模态属性特征。这一局限性阻碍了模型感知细粒度视觉细节的能力,并限制了其对更广泛未见类别的泛化能力。为解决这一问题,我们提出了一种多模态属性提示方法(MAP),通过联合探索文本属性提示、视觉属性提示和属性级对齐来实现。所提出的 MAP 具有若干优点。首先,我们引入了由文本属性语义增强的可学习视觉属性提示,以自适应地捕捉未知类别图像的视觉属性,从而提升 CLIP 的细粒度视觉感知能力。其次,所提出的属性级对齐补充了全局对齐,增强了开放词汇对象的跨模态对齐鲁棒性。据我们所知,这是首个为基于 CLIP 的少样本适配建立跨模态属性级对齐的工作。在 11 个数据集上的大量实验结果表明,我们的方法优于最先进的方法。
引用
@article{arxiv.2403.00219,
title = {Multi-modal Attribute Prompting for Vision-Language Models},
author = {Xin Liu and Jiamin Wu and and Wenfei Yang and Xu Zhou and Tianzhu Zhang},
journal= {arXiv preprint arXiv:2403.00219},
year = {2024}
}
备注
Accepted for Publication in IEEE Transactions on Circuits and Systems for Video Technology (TCSVT)