中文

增强文本搜索中视觉表征

计算机视觉与模式识别 2024-12-31 v1

摘要

文本搜索 person search 旨在根据文本描述从大规模图像数据库中检索匹配的行人。此任务的核心难点在于如何从行人图像和文本中提取有效细节,并在 common latent space 中实现跨模态对齐。先前工作采用预训练于单模态数据的图像和文本编码器分别提取图像和文本的全局和局部特征,然后显式实现全局-局部对齐。然而,这些方法仍缺乏理解视觉细节的能力,检索准确率仍受到 identity confusion 的限制。为缓解上述问题,我们重新思考视觉特征对文本 person search 的重要性,提出了 VFE-TPS(Visual Feature Enhanced Text-based Person Search),一种视觉特征增强文本搜索模型。它引入预训练的多模态主干 CLIP 来学习基本的多模态特征,并构建 Text Guided Masked Image Modeling 任务,以无需显式标注的方式增强模型学习局部视觉细节的能力。此外,我们设计了 Identity Supervised Global Visual Feature Calibration 任务,以指导模型学习 identity-aware 的全局视觉特征。我们的研究的关键发现是,通过我们的提议辅助任务,预训练 CLIP 模型嵌入的知识可以成功地适应文本 person search 任务,显著增强了模型的视觉理解能力。实验结果在三个基准数据集上表明,我们提议的模型超过了现有方法,Rank-1 准确率显著提高,提升幅度约为 1%9%1\%\sim9\%。我们的代码可在 https://github.com/zhangweifeng1218/VFE_TPS 获取。

关键词

引用

@article{arxiv.2412.20646,
  title  = {Enhancing Visual Representation for Text-based Person Searching},
  author = {Wei Shen and Ming Fang and Yuxia Wang and Jiafeng Xiao and Diping Li and Huangqun Chen and Ling Xu and Weifeng Zhang},
  journal= {arXiv preprint arXiv:2412.20646},
  year   = {2024}
}