中文

用于基于视频的行人检索的Transformer中多方向多尺度金字塔

计算机视觉与模式识别 2022-04-07 v2

摘要

在视频监控中,行人检索(亦称行人重识别)是一项关键任务。该任务旨在从非重叠相机中检索出感兴趣的行人。近来,基于Transformer的模型在此任务上取得了显著进展。然而,这些模型仍忽略了细粒度、部件级信息的问题。本文提出一种Transformer中的多方向多尺度金字塔(PiT)以解决该问题。在基于Transformer的架构中,每张行人图像被切分为多个图像块,随后这些图像块被送入Transformer层以获得该图像的特征表示。为挖掘细粒度信息,本文提出对这些图像块施加垂直划分与水平划分以生成不同方向的人体部件,这些部件提供了更细粒度的信息。为融合多尺度特征表示,本文提出一种包含全局级信息与来自不同尺度的多份局部级信息的金字塔结构。来自同一视频的所有行人图像的特征金字塔被融合以形成最终的多方向多尺度特征表示。在两个具挑战性的基于视频的基准MARS和iLIDS-VID上的实验结果表明,所提PiT取得了最先进的性能。充分的消融研究证明了所提金字塔结构的优越性。代码见 https://git.openi.org.cn/zangxh/PiT.git。

关键词

引用

@article{arxiv.2202.06014,
  title  = {Multi-direction and Multi-scale Pyramid in Transformer for Video-based Pedestrian Retrieval},
  author = {Xianghao Zang and Ge Li and Wei Gao},
  journal= {arXiv preprint arXiv:2202.06014},
  year   = {2022}
}

备注

10 pages, 6 figures, Accepted for publication in IEEE Transactions on Industrial Informatics