面向基于视频行人重识别的时间属性-表观学习网络
计算机视觉与模式识别
2020-09-10 v1
摘要
基于视频的行人重识别旨在跨不同时间与地点在监控视频中匹配特定行人。人体属性与表观互为补充,二者均有助于行人匹配。在本文中,我们提出一种新颖的时序属性-表观学习网络(TALNet)用于基于视频的行人重识别。TALNet 同时利用人体属性与表观从视频中学习全面而有效的行人表征。它针对属性探索困难视觉注意与时间-语义上下文,并针对表观探索身体部位间的时空依赖关系,以促进二者的学习。具体而言,提出一个带空间注意力块与时间-语义上下文块的属性分支网络,用于学习鲁棒的属性表征。空间注意力块使网络聚焦于视频帧内与每个属性相关的对应区域,时间-语义上下文块学习各属性跨视频帧的时间上下文以及各视频帧内属性间的语义上下文。表观分支网络旨在从整体与身体部位中学习有效的表观表征,并利用它们之间的时空依赖关系。TALNet 利用属性与表观表征间的互补性,并通过多任务学习方式进行联合优化。此外,我们在两个常用视频数据集上为每个行人标注了 ID 级属性。在这些数据集上的大量实验验证了 TALNet 相对于最先进方法的优越性。
引用
@article{arxiv.2009.04181,
title = {Temporal Attribute-Appearance Learning Network for Video-based Person Re-Identification},
author = {Jiawei Liu and Xierong Zhu and Zheng-Jun Zha},
journal= {arXiv preprint arXiv:2009.04181},
year = {2020}
}