中文

用于视频分类的 Token Shift Transformer

计算机视觉与模式识别 2021-08-06 v1 多媒体

摘要

Transformer 在理解一维与二维信号(如 NLP 与图像内容理解)方面取得了显著成功。作为卷积神经网络的潜在替代方案,它具有可解释性强、在超大规模数据上判别力强、处理变长输入灵活等优点。然而,其编码器天然包含如成对自注意力等计算密集型操作,在应用于复杂的三维视频信号时带来沉重计算负担。本文提出 Token Shift Module(即 TokShift),一种新颖的零参数、零 FLOPs 算子,用于在各个 transformer 编码器内建模时间关系。具体而言,TokShift 仅将部分 [Class] token 特征在相邻帧间来回进行时间偏移。随后,我们将该模块密集插入至普通 2D 视觉 transformer 的每个编码器中以学习三维视频表示。值得注意的是,我们的 TokShift transformer 是一种纯无卷积的视频 transformer 雏形,具有用于视频理解的计算高效性。在标准基准上的实验验证了其鲁棒性、有效性与高效性。特别地,在输入片段为 8/12 帧时,TokShift transformer 取得了 SOTA 精度:在 Kinetics-400 上为 79.83%/80.40%,在 EGTEA-Gaze+ 上为 66.56%,在 UCF-101 数据集上为 96.80%,可比或优于现有 SOTA 卷积对应方法。我们的代码已开源:https://github.com/VideoNetworks/TokShift-Transformer。

关键词

引用

@article{arxiv.2108.02432,
  title  = {Token Shift Transformer for Video Classification},
  author = {Hao Zhang and Yanbin Hao and Chong-Wah Ngo},
  journal= {arXiv preprint arXiv:2108.02432},
  year   = {2021}
}

备注

ACM Multimedia 2021, 9 pages, 5 figures