用于RGB-D动作与手势识别的多阶段分解时空表征
计算机视觉与模式识别
2023-09-12 v2
摘要
RGB-D动作与手势识别在以人为中心的场景理解中仍是一个有趣的话题,主要由于人类运动的多粒度性和大差异性。尽管许多基于RGB-D的动作与手势识别方法通过利用跨多模态(即RGB和深度数据)的高度集成时空表征已展现出显著成果,它们仍面临若干挑战。首先,普通3D卷积难以捕捉不同模态下局部片段间的细粒度运动差异。其次,高度集成时空建模的复杂性会导致优化困难。第三,重复和冗余信息会增加复杂性并使纠缠的时空建模复杂化。为解决上述问题,我们提出了一种称为多阶段分解时空(MFST)的创新启发式架构用于RGB-D动作与手势识别。所提MFST模型包含3D中心差分卷积主干(CDC-Stem)模块和多个分解时空阶段。CDC-Stem丰富了细粒度时间感知,多个分层时空阶段构建了维度独立的高阶语义基元。具体而言,CDC-Stem模块捕捉底层时空特征,并将其依次传递给后续时空分解阶段,通过多尺度卷积与Transformer(MSC-Trans)混合块和权重共享多尺度Transformer(WMS-Trans)块捕捉分层空间与时间特征。这些创新设计的无缝集成产生了鲁棒的时空表征,在RGB-D动作与手势识别数据集上优于最先进的方法。
引用
@article{arxiv.2308.12006,
title = {Multi-stage Factorized Spatio-Temporal Representation for RGB-D Action and Gesture Recognition},
author = {Yujun Ma and Benjia Zhou and Ruili Wang and Pichao Wang},
journal= {arXiv preprint arXiv:2308.12006},
year = {2023}
}
备注
ACM MM'23