中文

TubeR:用于视频动作检测的管状片段 Transformer

计算机视觉与模式识别 2022-05-11 v5

摘要

我们提出 TubeR:一种用于时空视频动作检测的简单方案。与依赖离线演员检测器或手工设计的演员位置假设(如提议或锚框)的现有方法不同,我们提出通过从单一表示中同时执行动作定位与识别,直接在视频中检测动作管状片段。TubeR 学习一组管状片段查询,并利用管状片段注意力模块对视频片段的动态时空特性进行建模,与在时空空间中使用演员位置假设相比,这有效增强了模型能力。对于包含过渡状态或场景变化的视频,我们提出上下文感知分类头以利用短期和长期上下文来加强动作分类,以及动作切换回归头来检测精确的时间动作范围。TubeR 直接生成可变长度的 action tubelet,甚至对长视频片段也能保持良好结果。TubeR 在常用动作检测数据集 AVA、UCF101-24 和 JHMDB51-21 上优于先前的最先进方法。

关键词

引用

@article{arxiv.2104.00969,
  title  = {TubeR: Tubelet Transformer for Video Action Detection},
  author = {Jiaojiao Zhao and Yanyi Zhang and Xinyu Li and Hao Chen and Shuai Bing and Mingze Xu and Chunhui Liu and Kaustav Kundu and Yuanjun Xiong and Davide Modolo and Ivan Marsic and Cees G. M. Snoek and Joseph Tighe},
  journal= {arXiv preprint arXiv:2104.00969},
  year   = {2022}
}

备注

Accepted at CVPR 2022 (Oral)