Trear:基于 Transformer 的 RGB-D 第一人称动作识别
计算机视觉与模式识别
2021-01-12 v1
摘要
本文提出一种基于 Transformer 的 RGB-D 第一人称动作识别框架,称为 Trear。其由两个模块组成:帧间注意力编码器与互注意力融合块。我们采用自注意力机制对不同模态数据的时间结构进行建模,而非使用光流或循环单元。输入帧经随机裁剪以缓解数据冗余的影响。各模态特征通过所提出的融合块进行交互,并经由一种简单而有效的融合操作组合,以产生联合的 RGB-D 表示。在两个大型第一人称 RGB-D 数据集 THU-READ 和 FPHA 以及一个小型数据集 WCVS 上的实证实验表明,所提方法大幅优于当前最优结果。
引用
@article{arxiv.2101.03904,
title = {Trear: Transformer-based RGB-D Egocentric Action Recognition},
author = {Xiangyu Li and Yonghong Hou and Pichao Wang and Zhimin Gao and Mingliang Xu and Wanqing Li},
journal= {arXiv preprint arXiv:2101.03904},
year = {2021}
}
备注
Accepted by IEEE Transactions