中文

双提示学习:用于适应下游图像-文本检索任务的视觉-语言模型

计算机视觉与模式识别 2025-08-07 v1 信息检索

摘要

最近,提示学习在适应各种下游任务如图像分类的视觉-语言模型 (VLM) 上显示出惊人的成功。然而,其应用于下游图像-文本检索 (ITR) 任务仍面临更大挑战。我们发现,挑战在于区分下游数据的细粒度属性和相似子类别。为解决这一挑战,我们提出了一种具备双提示学习与联合类别-属性重加权 (DCAR) 的框架,以实现精确的图像-文本匹配。该框架从语义和视觉维度动态调整提示向量以提高 CLIP 在下游 ITR 任务上的性能。基于提示范式,DCAR 联合优化属性和类别特征以增强细粒度表征学习。具体而言,(1) 在属性层面,它根据文本-图像互信息相关性动态更新属性描述的权重; (2) 在类别层面,它引入来自多个角度的负样本并采用类别匹配加权来学习子类别差异。为验证我们的方法,我们构建了细分类描述检索数据集 (FDRD),作为下游数据域中 ITR 的具有挑战性的基准。它涵盖超过 1,500 个下游细分类和 230,000 条图像-caption 对,并包含详细的属性标注。FDRD 上的广泛实验表明,DCAR 在现有基线上实现了最先进的性能。

关键词

引用

@article{arxiv.2508.04028,
  title  = {Dual Prompt Learning for Adapting Vision-Language Models to Downstream Image-Text Retrieval},
  author = {Yifan Wang and Tao Wang and Chenwei Tang and Caiyang Yu and Zhengqing Zang and Mengmi Zhang and Shudong Huang and Jiancheng Lv},
  journal= {arXiv preprint arXiv:2508.04028},
  year   = {2025}
}

备注

10 pages, 7figures