中文

基于三维可变形注意力的跨模态学习用于动作识别

计算机视觉与模式识别 2023-08-21 v3

摘要

基于视觉的动作识别中的一个重要挑战,是将具有两种或更多异质模态的时空特征嵌入到单一特征中。在本研究中,我们提出了一种用于动作识别的新型三维可变形 transformer,其具有自适应时空感受野与跨模态学习方案。该三维可变形 transformer 由三个注意力模块组成:三维可变形、局部关节步幅以及时间步幅注意力。两个跨模态 token 被输入三维可变形注意力模块以生成反映时空相关性的交叉注意力 token。局部关节步幅注意力用于在空间上结合注意力与姿态 token。时间步幅注意力在时序上减少注意力模块中输入 token 的数量,并支持无需同时使用所有 token 的时间表达学习。该可变形 transformer 迭代 L 次并组合最后的跨模态 token 用于分类。所提出的三维可变形 transformer 在 NTU60、NTU120、FineGYM 和 PennAction 数据集上进行了测试,即使未经预训练过程,也展现出优于或类似于预训练 SOTA 方法的结果。此外,通过空间关节与时间步幅注意力可视化动作识别中的重要关节与相关性,展示了实现动作识别可解释潜力的可能性。

关键词

引用

@article{arxiv.2212.05638,
  title  = {Cross-Modal Learning with 3D Deformable Attention for Action Recognition},
  author = {Sangwon Kim and Dasom Ahn and Byoung Chul Ko},
  journal= {arXiv preprint arXiv:2212.05638},
  year   = {2023}
}

备注

Accepted by ICCV2023