中文

基于语义驱动候选框生成的全图像文本行人搜索

计算机视觉与模式识别 2024-02-27 v3 人工智能

摘要

利用文本描述查询在完整场景图像中查找目标行人,在智能视频监控中具有重要求用价值。然而,不同于真实世界中边界框不可用的场景,现有的基于文本的行人检索方法主要关注查询文本描述与裁剪后行人图像库之间的跨模态匹配。为缩小这一差距,我们研究了全图像中的基于文本的行人搜索问题,提出一种新的端到端学习框架,联合优化行人检测、识别与视觉-语义特征嵌入任务。为充分利用查询文本,语义特征被用于指导区域候选网络(Region Proposal Network)更多地关注文本所描述的候选框。此外,采用跨尺度视觉-语义嵌入机制以提升性能。为验证所提方法,我们基于广泛采用的基于图像的行人搜索数据集 CUHK-SYSU 和 PRW 收集并标注了两个大规模基准数据集。在两个数据集上进行了综合实验,与基线方法相比,我们的方法达到了最先进的性能(state-of-the-art)。

关键词

引用

@article{arxiv.2109.12965,
  title  = {Text-based Person Search in Full Images via Semantic-Driven Proposal Generation},
  author = {Shizhou Zhang and De Cheng and Wenlong Luo and Yinghui Xing and Duo Long and Hao Li and Kai Niu and Guoqiang Liang and Yanning Zhang},
  journal= {arXiv preprint arXiv:2109.12965},
  year   = {2024}
}