中文

基于视频的人员重识别的密集交互学习

计算机视觉与模式识别 2021-08-18 v3

摘要

基于视频的人员重识别(re-ID)旨在跨视频片段匹配同一个人。高效利用多尺度细粒度特征并在其间建立结构性交互是其成功的关键。在本文中,我们提出一种混合框架——密集交互学习(DenseIL),它结合了基于 CNN 和基于注意力机制的架构的主要优势来解决基于视频的人员重识别的困难。DenseIL 包含一个 CNN 编码器和一个密集交互(DI)解码器。CNN 编码器负责高效提取判别性空间特征,而 DI 解码器旨在密集建模跨帧的时空固有交互。与先前工作不同,我们额外让 DI 解码器密集关注中间的细粒度 CNN 特征,这自然地为每个视频片段产生多粒度时空表示。此外,我们将时空位置嵌入(STEP-Emb)引入 DI 解码器以探究时空输入之间的位置关系。我们的实验在多个标准基于视频的人员重识别数据集上一致且显著优于所有最先进的方法。

关键词

引用

@article{arxiv.2103.09013,
  title  = {Dense Interaction Learning for Video-based Person Re-identification},
  author = {Tianyu He and Xin Jin and Xu Shen and Jianqiang Huang and Zhibo Chen and Xian-Sheng Hua},
  journal= {arXiv preprint arXiv:2103.09013},
  year   = {2021}
}

备注

ICCV 2021, Oral