中文

DirecFormer:一种面向鲁棒动作识别的Transformer定向注意力方法

计算机视觉与模式识别 2022-03-22 v1

摘要

人体动作识别近来已成为计算机视觉领域的热门研究课题之一。各种基于3D-CNN的方法已被提出,以处理视频动作识别任务中的空间和时间维度,并取得了有竞争力的结果。然而,这些方法存在一些根本性的局限,如缺乏鲁棒性和泛化能力,例如,视频帧的时间顺序如何影响识别结果?本工作提出了一种新颖的端到端基于Transformer的定向注意力(DirecFormer)框架,用于鲁棒的动作识别。该方法采用了一种简单但新颖的基于Transformer的视角来理解序列动作的正确顺序。因此,本工作的贡献有三方面。首先,我们将有序时间学习问题引入到动作识别问题中。其次,引入了一种新的定向注意力机制,以正确的顺序理解并关注人体动作。第三,我们在包含顺序和类别的动作序列建模中引入了条件依赖。与近期的动作识别方法相比,所提出的方法在三个标准大规模基准(即Jester、Kinetics-400和Something-Something-V2)上持续取得了最先进(SOTA)的结果。

关键词

引用

@article{arxiv.2203.10233,
  title  = {DirecFormer: A Directed Attention in Transformer Approach to Robust Action Recognition},
  author = {Thanh-Dat Truong and Quoc-Huy Bui and Chi Nhan Duong and Han-Seok Seo and Son Lam Phung and Xin Li and Khoa Luu},
  journal= {arXiv preprint arXiv:2203.10233},
  year   = {2022}
}

备注

Accepted to CVPR 2022