面向基于视频的行人重识别的时空高效非局部注意力网络
计算机视觉与模式识别
2019-08-06 v1
摘要
基于视频的行人重识别(Re-ID)旨在跨非重叠相机匹配行人的视频序列。如何将视频的时空信息嵌入其特征表示是一个实用且具有挑战性的任务。虽然现有多数方法通过聚合图像级特征并在神经网络中设计注意力机制来学习视频特性,但它们仅在高层特征上探索帧间相关性。本工作中,我们以非局部注意力操作精炼中间特征及高层特征为目标,并作出两点贡献。(i)我们提出非局部视频注意力网络(NVAN),以在多个特征层级将视频特性融入表示。(ii)我们进一步引入时空高效非局部视频注意力网络(STE-NVAN),通过利用行人视频中存在的时空冗余来降低计算复杂度。大量实验表明,我们的NVAN在MARS数据集上以3.8%的rank-1准确率优于当前最优方法,并证实我们的STE-NVAN相比现有方法展现出远优的计算开销。
引用
@article{arxiv.1908.01683,
title = {Spatially and Temporally Efficient Non-local Attention Network for Video-based Person Re-Identification},
author = {Chih-Ting Liu and Chih-Wei Wu and Yu-Chiang Frank Wang and Shao-Yi Chien},
journal= {arXiv preprint arXiv:1908.01683},
year = {2019}
}
备注
This paper was accepted by 2019 British Machine Vision Conference (BMVC)