中文

TIPCB:一种简洁而有效的基于部件的卷积基线用于基于文本的人员搜索

计算机视觉与模式识别 2021-05-26 v1

摘要

基于文本的人员搜索是图像检索领域的一个子任务,旨在根据给定文本描述检索目标人物图像。两种模态间显著的特征鸿沟使该任务极具挑战性。许多现有方法尝试利用局部对齐在细粒度层面解决此问题。然而,大多数相关方法引入了额外模型或复杂的训练与评估策略,难以在真实场景中应用。为促进实际应用,我们提出了一种简洁而有效的端到端学习框架用于基于文本的人员搜索,名为TIPCB(即Text-Image Part-based Convolutional Baseline)。首先,提出一种新颖的双路局部对齐网络结构以提取视觉和文本局部表示,其中图像被水平分割、文本自适应对齐。然后,我们提出多阶段跨模态匹配策略,从低层、局部层和全局层三个特征层面消除模态鸿沟。在广泛使用基准数据集(CUHK-PEDES)上进行了大量实验,并验证我们的方法在Top-1、Top-5和Top-10上分别以3.69%、2.95%和2.31%优于最先进方法。我们的代码已发布于https://github.com/OrangeYHChen/TIPCB。

关键词

引用

@article{arxiv.2105.11628,
  title  = {TIPCB: A Simple but Effective Part-based Convolutional Baseline for Text-based Person Search},
  author = {Yuhao Chen and Guoqing Zhang and Yujiang Lu and Zhenxing Wang and Yuhui Zheng and Ruili Wang},
  journal= {arXiv preprint arXiv:2105.11628},
  year   = {2021}
}

备注

27 pages