面向基于视频的人员重识别的多粒度图池化
计算机视觉与模式识别
2022-09-26 v1
摘要
基于视频的人员重识别 (ReID) 旨在跨多个非重叠摄像机识别给定的行人视频序列。为了聚合视频样本的时间与空间特征,图神经网络 (GNNs) 被引入。然而,现有的基于图的模型(如 STGCN)对节点特征执行 \textit{mean}/\textit{max pooling} 以获得图表示,忽略了图拓扑与节点重要性。本文提出图池化网络 (GPNet) 来学习用于视频检索的多粒度图表示,其中实现了 \textit{图池化层} 对图进行下采样。我们首先构建多粒度图,其节点特征表示由骨干网络学习到的图像嵌入,边建立于时间邻域与欧氏邻域节点之间。然后我们实现多个图卷积层以在图上进行邻域聚合。为对图下采样,我们提出多头全注意力图池化 (MHFAPool) 层,其融合了现有节点聚类与节点选择池化方法的优势。具体而言,MHFAPool 以全注意力矩阵的主特征向量作为聚合系数,使每个池化节点都融入全局图信息。大量实验表明,我们的 GPNet 在四个广泛使用的数据集 MARS、DukeMTMC-VideoReID、iLIDS-VID 和 PRID-2011 上取得了具有竞争力的结果。
引用
@article{arxiv.2209.11584,
title = {Multi-Granularity Graph Pooling for Video-based Person Re-Identification},
author = {Honghu Pan and Yongyong Chen and Zhenyu He},
journal= {arXiv preprint arXiv:2209.11584},
year = {2022}
}