重新审视基于视频的人员重识别在语义与时间层面的时序融合
计算机视觉与模式识别
2020-09-14 v1 机器学习
图像与视频处理
摘要
近来,人员重识别(ReID)的研究兴趣逐渐转向基于视频的方法,其通过聚合整段视频的帧特征来获取人员表示。然而,现有基于视频的 ReID 方法未考虑不同网络阶段输出所带来的语义差异,这可能损害人员特征的信息丰富度。此外,传统方法忽略帧间重要关系,导致沿时间轴融合时的信息冗余。为解决这些问题,我们提出一种新颖的通用时序融合框架,在语义层面与时间层面共同聚合帧特征。在语义层面,探索多阶段融合网络以在多个语义层级融合更丰富的帧特征,可有效减少传统单阶段融合造成的信息损失。而在时间轴上,通过增添新颖的帧间注意力模块改进现有帧内注意力方法,借由考虑帧间关系有效降低时序融合中的信息冗余。实验结果表明,我们的方法能有效提升基于视频的重识别精度,取得当前最优性能。
引用
@article{arxiv.1911.12512,
title = {Rethinking Temporal Fusion for Video-based Person Re-identification on Semantic and Time Aspect},
author = {Xinyang Jiang and Yifei Gong and Xiaowei Guo and Qize Yang and Feiyue Huang and Weishi Zheng and Feng Zheng and Xing Sun},
journal= {arXiv preprint arXiv:1911.12512},
year = {2020}
}