中文

利用视觉-语言预训练中的文本潜力进行基于文本的人员检索

计算机视觉与模式识别 2023-03-09 v1

摘要

基于文本的人员检索(Text-based Person Search, TPS)旨在检索与文本描述而非查询图像匹配的行人。近期的视觉-语言预训练(Vision-Language Pre-training, VLP)模型可为下游TPS任务带来可迁移知识,从而实现更高效的性能提升。然而,现有经VLP改进的TPS方法仅利用预训练视觉编码器,忽视了相应的文本表示,并破坏了从大规模预训练中习得的重要模态对齐。本文探索在TPS任务中充分利用VLP的文本潜力。我们基于所提出的VLP-TPS基线模型构建,该模型是首个同时具备两种预训练模态的TPS模型。我们提出多完整性描述约束(Multi-Integrity Description Constraints, MIDC),通过在训练时融入细粒度语料的不同组成部分来增强文本模态的鲁棒性。受VLP模型用于零样本分类的提示方法启发,我们提出动态属性提示(Dynamic Attribute Prompt, DAP),为图像模态提供细粒度属性的统一语料作为语言提示。大量实验表明,我们提出的TPS框架取得了最先进的性能,超越此前最佳方法的幅度显著。

关键词

引用

@article{arxiv.2303.04497,
  title  = {Exploiting the Textual Potential from Vision-Language Pre-training for Text-based Person Search},
  author = {Guanshuo Wang and Fufu Yu and Junjie Li and Qiong Jia and Shouhong Ding},
  journal= {arXiv preprint arXiv:2303.04497},
  year   = {2023}
}

备注

10 pages, 6 figures