中文

一种用于动作检测的高效时空金字塔 Transformer

计算机视觉与模式识别 2022-07-22 v1

摘要

动作检测任务旨在推断长未修剪视频中每个动作实例的类别及起止时刻定位。尽管视觉 Transformer 推动了视频理解的最新进展,但由于对长视频片段序列的自注意力计算代价高昂,设计高效的动作检测架构并非易事。为此,我们提出一种用于动作检测的高效分层时空金字塔 Transformer(STPT),其基于 Transformer 中早期自注意力层仍关注局部模式这一事实。具体而言,我们提议在早期阶段使用局部窗口注意力编码丰富的局部时空表示,而在后期阶段应用全局注意力模块捕捉长程时空依赖。如此,我们的 STPT 能以大幅降低的冗余编码局部性与依赖性,在精度与效率间取得良好权衡。例如,仅用 RGB 输入,所提 STPT 在 THUMOS14 上取得 53.6% mAP,超越 I3D+AFSD RGB 模型逾 10%,并以少 31% GFLOPs 的性能优于使用额外光流特征的当前最优 AFSD,成为一种高效且有效的基于端到端 Transformer 的动作检测框架。

关键词

引用

@article{arxiv.2207.10448,
  title  = {An Efficient Spatio-Temporal Pyramid Transformer for Action Detection},
  author = {Yuetian Weng and Zizheng Pan and Mingfei Han and Xiaojun Chang and Bohan Zhuang},
  journal= {arXiv preprint arXiv:2207.10448},
  year   = {2022}
}

备注

Accepted to ECCV 2022