BiCnet-TKS:学习用于视频行人重识别的高效时空表示
计算机视觉与模式识别
2021-05-03 v1
摘要
本文提出一种用于视频行人重识别(reID)的高效时空表示。首先,我们提出双边互补网络(BiCnet)用于空间互补建模。具体而言,BiCnet 含两个分支:细节分支以原始分辨率处理帧以保留细致视觉线索,采用下采样策略的上下文分支用于捕获长程上下文。在各分支上,BiCnet 附加多个并行且多样的注意力模块,以发现连续帧中不同的身体部位,从而获得目标身份的整体特征。此外,设计时间核选择(TKS)模块,通过自适应模式捕获短期与长期时间关系。TKS 可插入 BiCnet 任意深度以构建 BiCnetTKS 进行时空建模。多个基准上的实验结果表明,BiCnet-TKS 以约 50% 更少的计算量优于现有最优方法。源代码见 https://github.com/blue-blue272/BiCnet-TKS。
引用
@article{arxiv.2104.14783,
title = {BiCnet-TKS: Learning Efficient Spatial-Temporal Representation for Video Person Re-Identification},
author = {Ruibing Hou and Hong Chang and Bingpeng Ma and Rui Huang and Shiguang Shan},
journal= {arXiv preprint arXiv:2104.14783},
year = {2021}
}
备注
Accepted by IEEE Conference on Computer Vision and Pattern Recognition (CVPR 2021) 2021