用于步态识别的多尺度上下文感知 Transformer 网络
计算机视觉与模式识别
2023-09-27 v3
摘要
尽管步态识别最近引起了越来越多的研究关注,但由于轮廓差异在空间域中非常细微,时间特征表示对于步态识别至关重要。受人类可以通过自适应地关注不同时间尺度的片段来区分不同主体的步态这一观察的启发,我们提出了一种用于步态识别的多尺度上下文感知 Transformer 网络(MCAT)。MCAT 生成跨三个尺度的时间特征,并利用来自局部和全局视角的上下文信息自适应地聚合它们。具体来说,MCAT 包含一个自适应时间聚合(ATA)模块,该模块先执行局部关系建模,然后进行全局关系建模,以融合多尺度特征。此外,为了弥补因时间操作导致的空间特征损坏,MCAT 引入了一个显著空间特征学习(SSFL)模块,用于选择具有判别性的空间特征组。在三个数据集上进行的大量实验证明了其最先进的性能。具体而言,在 CASIA-B 数据集上,我们在正常行走、背包和穿大衣条件下分别达到了 98.7%、96.2% 和 88.7% 的 Rank-1 准确率,在 OU-MVLP 上达到 97.5%,在 GREW 上达到 50.6%。源代码将在 https://github.com/zhuduowang/MCAT.git 上发布。
引用
@article{arxiv.2204.03270,
title = {Multi-scale Context-aware Network with Transformer for Gait Recognition},
author = {Duowang Zhu and Xiaohu Huang and Xinggang Wang and Bo Yang and Botao He and Wenyu Liu and Bin Feng},
journal= {arXiv preprint arXiv:2204.03270},
year = {2023}
}
备注
Extensions of CSTL