中文

基于时空记忆网络的视频行人重识别

计算机视觉与模式识别 2021-08-23 v1

摘要

基于视频的行人重识别(reID)旨在跨多个摄像头检索与查询行人身份相同的行人视频。行人视频中的空间与时间干扰因素(分别为背景杂波和跨帧的部分遮挡)使得该任务比基于图像的行人重识别更具挑战性。我们观察到空间干扰因素在特定位置持续出现,而时间干扰因素呈现若干模式,例如部分遮挡出现在前几帧中,这些模式为预测应关注哪些帧(即时间注意力)提供了信息线索。基于此,我们提出一种新颖的时空记忆网络(STMN)。空间记忆存储跨视频帧频繁出现的空间干扰因素特征,而时间记忆保存针对行人视频中典型时间模式优化得到的注意力。我们分别利用空间和时间记忆来精炼帧级行人表征,并将精炼后的帧级特征聚合为序列级行人表征,从而有效处理行人视频中的空间和时间干扰因素。我们还引入了一种记忆扩散损失,防止模型仅处理记忆中的特定条目。在包括 MARS、DukeMTMC-VideoReID 和 LS-VID 在内的标准基准上的实验结果证明了我们方法的有效性。

关键词

引用

@article{arxiv.2108.09039,
  title  = {Video-based Person Re-identification with Spatial and Temporal Memory Networks},
  author = {Chanho Eom and Geon Lee and Junghyup Lee and Bumsub Ham},
  journal= {arXiv preprint arXiv:2108.09039},
  year   = {2021}
}

备注

International Conference on Computer Vision (ICCV) 2021