中文

用于端到端行人搜索的序列Transformer

计算机视觉与模式识别 2022-11-17 v2

摘要

行人搜索旨在从真实且未经裁剪的图库图像中同时定位和识别目标行人。行人搜索的一个主要挑战源于两个子任务相互矛盾的目标,即行人检测侧重于发现所有行人的共性以将行人与背景区分开,而行人重识别(re-ID)则侧重于不同行人之间的差异。本文提出了一种新颖的序列Transformer(SeqTR),用于端到端行人搜索以应对这一挑战。我们的SeqTR包含一个检测Transformer和一个新颖的重识别Transformer,它们顺序地处理检测和重识别任务。重识别Transformer包含利用上下文信息的自注意力层和学习人体局部细粒度判别性特征的交叉注意力层。此外,重识别Transformer由多尺度特征共享和监督,以提高所学行人表示的鲁棒性。在两个广泛使用的行人搜索基准数据集CUHK-SYSU和PRW上的大量实验表明,我们提出的SeqTR不仅在PRW上以59.3%的mAP优于所有现有的行人搜索方法,而且在CUHK-SYSU上以94.8%的mAP取得了与最先进结果相当的性能。

关键词

引用

@article{arxiv.2211.04323,
  title  = {Sequential Transformer for End-to-End Person Search},
  author = {Long Chen and Jinhua Xu},
  journal= {arXiv preprint arXiv:2211.04323},
  year   = {2022}
}