GaitMA:面向步态识别的姿态引导多模态特征融合
计算机视觉与模式识别
2024-07-23 v1
摘要
步态识别是一种通过人行走模式识别人类身份的生物识别技术。现有的基于外观的方法利用CNN或Transformer提取胶片的空间和时间特征,而基于模型的方法则采用GCN专注于骨架点的特殊拓扑结构。然而,胶片质量受到复杂遮挡的限制,骨架缺乏人体稠密语义特征。为此,我们提出一种新型步态识别框架,称为Gait Multi-model Aggregation Network(GaitMA),有效组合两种模态以获得更稳健和全面的步态表示用于识别。首先,骨架通过关节/肢体基于热图表示,利用两个基于CNN的特征提取器分别提取胶片和骨架的特征。其次,提出一种协注意力对齐模块,通过元素级注意力对齐特征。最后,我们提出一种互学习模块,通过交叉注意力实现特征融合,进而引入Wasserstein损失以确保两种模态的有效融合。大量实验结果表明,我们的模型在Gait3D、OU-MVLP和CASIA-B上表现优异。
关键词
引用
@article{arxiv.2407.14812,
title = {GaitMA: Pose-guided Multi-modal Feature Fusion for Gait Recognition},
author = {Fanxu Min and Shaoxiang Guo and Fan Hao and Junyu Dong},
journal= {arXiv preprint arXiv:2407.14812},
year = {2024}
}
备注
Accepted to ICME 2024