中文

一段视频胜三视图:面向基于视频的人员重识别的三叉Transformer

计算机视觉与模式识别 2021-04-06 v1 人工智能

摘要

基于视频的人员重识别(Re-ID)旨在跨非重叠摄像头检索同一人的视频序列。以往方法通常聚焦于有限视图,如空间、时间或时空视图,缺乏对不同特征域的观察。为获取更丰富的感知并提取更全面的视频表征,本文提出一种名为三叉Transformer(TMT)的新框架用于基于视频的人员重识别。具体而言,我们设计了一个三叉特征提取器,将原始视频数据联合变换至空间、时间和时空域。此外,受视觉Transformer巨大成功的启发,我们将Transformer结构引入基于视频的人员重识别。本工作中,提出三个自视图Transformer以挖掘局部特征间关系,在空间、时间和时空域中进行信息增强。同时,提出一个跨视图Transformer以聚合多视图特征,得到全面的视频表征。实验结果表明,我们的方法在公开Re-ID基准上优于其他最先进方法。我们将发布代码以供模型复现。

关键词

引用

@article{arxiv.2104.01745,
  title  = {A Video Is Worth Three Views: Trigeminal Transformers for Video-based Person Re-identification},
  author = {Xuehu Liu and Pingping Zhang and Chenyang Yu and Huchuan Lu and Xuesheng Qian and Xiaoyun Yang},
  journal= {arXiv preprint arXiv:2104.01745},
  year   = {2021}
}

备注

This work includes 10 pages, 5 figures and 4 Tables