自增强改进基础视觉语言模型中的文本-图像检索
计算机视觉与模式识别
2023-06-13 v1
摘要
跨模态基础模型的出现引入了众多基于文本-图像检索的方法。然而,在一些特定领域的检索任务上,这些模型未能聚焦于所需的关键属性。为解决此问题,我们提出了一种基于最大跨模态模型之一 CLIP-ViT/G-14 的自增强框架 A^{3}R。首先,我们在模型学习前执行属性增强(Attribute Augmentation)策略,以丰富文本描述从而获得细粒度表示。然后,我们提出自适应重排序(Adaption Re-ranking)方法,在模型学习后统一文本查询与候选图像的表达空间,并依据自适应后的查询对候选图像重排序。所提框架在首届基础模型挑战赛的跨模态图像检索赛道中被验证相较基线及其他团队方案取得了显著提升,且未引入任何额外样本。代码见 \url{https://github.com/CapricornGuang/A3R}。
引用
@article{arxiv.2306.06691,
title = {Self-Enhancement Improves Text-Image Retrieval in Foundation Visual-Language Models},
author = {Yuguang Yang and Yiming Wang and Shupeng Geng and Runqi Wang and Yimi Wang and Sheng Wu and Baochang Zhang},
journal= {arXiv preprint arXiv:2306.06691},
year = {2023}
}
备注
Accepted by CVPR 2023 Workshop