深入探索多模态提示用于细粒度视觉分类
计算机视觉与模式识别
2023-12-14 v2 多媒体
摘要
细粒度视觉分类 (FGVC) 涉及对 broader 类别中的精细子类进行归类,由于细微的类间差异和较大的类内变化而具有挑战性。然而,主流方法主要关注单模态视觉概念。预训练视觉-语言模型的最新进展已在各种高层视觉任务中展现出卓越性能,但此类模型对 FGVC 任务的适用性仍不确定。本文旨在充分利用跨模态描述的能力来解决 FGVC 任务,并基于对比语言-图像预训练 (CLIP) 模型提出一种新颖的多模态提示方案,记为 MP-FGVC。我们的 MP-FGVC 包含多模态提示方案和一多模态适配方案。前者包括子类特定视觉提示 (SsVP) 和差异感知文本提示 (DaTP),从视觉和语言两个角度显式突出子类特定差异。后者在公共语义空间中对齐视觉与文本提示元素,通过视觉-语言融合模块 (VLFM) 促进跨模态协同推理,以进一步改进 FGVC。此外,我们为 MP-FGVC 量身定制了两阶段优化策略,以充分利用预训练 CLIP 模型并加速 FGVC 的高效适配。在四个 FGVC 数据集上的大量实验证明了我们的 MP-FGVC 的有效性。
引用
@article{arxiv.2309.08912,
title = {Delving into Multimodal Prompting for Fine-grained Visual Classification},
author = {Xin Jiang and Hao Tang and Junyao Gao and Xiaoyu Du and Shengfeng He and Zechao Li},
journal= {arXiv preprint arXiv:2309.08912},
year = {2023}
}
备注
This paper is accepted by AAAI 2024