何处与何时关注:基于视频的行人重识别的深度连体注意力网络
计算机视觉与模式识别
2018-10-17 v2
摘要
基于视频的行人重识别(re-id)是监控系统中的核心应用,在安全方面备受关注。由于巨大的视觉变化和无控帧率,在视频片段中跨不相交摄像机视角匹配行人 inherently 具有挑战性。有两个步骤对行人重识别至关重要,即判别特征学习和度量学习。然而,现有方法独立考虑这两个步骤,且未充分利用视频中的时空信息。在本文中,我们提出一种连体注意力架构,联合学习时空视频表示及其相似性度量。该网络从每帧的区域提取局部卷积特征,并在与另一行人视频度量相似性时通过关注不同区域增强其判别能力。注意力机制嵌入到空间门控循环单元中,以选择性传播相关特征并记忆其空间依赖关系。该模型本质上学习哪些部分(何处)来自哪些帧(何时)对于匹配行人是相关且具区分性的,并赋予其更高的重要性。所提出的连体模型是端到端可训练的,以联合学习成对行人视频的可比隐表示及其相似性值。在三个基准数据集上的大量实验显示了所提出深度网络各组件的有效性,同时优于最先进的方法。
引用
@article{arxiv.1808.01911,
title = {Where-and-When to Look: Deep Siamese Attention Networks for Video-based Person Re-identification},
author = {Lin Wu and Yang Wang and Junbin Gao and Xue Li},
journal= {arXiv preprint arXiv:1808.01911},
year = {2018}
}
备注
Appearing in IEEE Transactions on Multimedia. arXiv admin note: text overlap with arXiv:1606.01609