面向基于视频的人员重识别的上下文感知注意力网络
计算机视觉与模式识别
2022-07-07 v1
摘要
基于视频的人员重识别(ReID)由于视频帧中存在各种干扰而具有挑战性。近期方法使用时间聚合策略处理该问题。在本文中,我们提出一种新颖的上下文感知注意力网络(CSA-Net),它改进了帧特征提取和时间聚合两个步骤。首先,我们引入上下文感知通道注意力(CSCA)模块,该模块对每个帧中来自信息丰富通道的响应进行强调。这些信息丰富通道的确定不仅参考每一单独帧,还参考整个序列的内容。因此,CSCA 同时探索了每帧的个体性与序列的全局上下文。其次,我们提出对比特征聚合(CFA)模块,用于预测时间聚合的帧权重。此处每帧的权重以对比方式确定:即不仅由每单独帧的质量,还由序列中其他帧的平均质量决定。因此,它有效提升了相对优质帧的贡献。在四个数据集上的大量实验结果表明,CSA-Net 持续取得最先进的性能。
引用
@article{arxiv.2207.02631,
title = {Context Sensing Attention Network for Video-based Person Re-identification},
author = {Kan Wang and Changxing Ding and Jianxin Pang and Xiangmin Xu},
journal= {arXiv preprint arXiv:2207.02631},
year = {2022}
}