中文

Trear:基于 Transformer 的 RGB-D 第一人称动作识别

计算机视觉与模式识别 2021-01-12 v1

摘要

本文提出一种基于 Transformer 的 RGB-D 第一人称动作识别框架,称为 Trear。其由两个模块组成:帧间注意力编码器与互注意力融合块。我们采用自注意力机制对不同模态数据的时间结构进行建模,而非使用光流或循环单元。输入帧经随机裁剪以缓解数据冗余的影响。各模态特征通过所提出的融合块进行交互,并经由一种简单而有效的融合操作组合,以产生联合的 RGB-D 表示。在两个大型第一人称 RGB-D 数据集 THU-READ 和 FPHA 以及一个小型数据集 WCVS 上的实证实验表明,所提方法大幅优于当前最优结果。

关键词

引用

@article{arxiv.2101.03904,
  title  = {Trear: Transformer-based RGB-D Egocentric Action Recognition},
  author = {Xiangyu Li and Yonghong Hou and Pichao Wang and Zhimin Gao and Mingliang Xu and Wanqing Li},
  journal= {arXiv preprint arXiv:2101.03904},
  year   = {2021}
}

备注

Accepted by IEEE Transactions