中文

用于视频动作识别的时间段网络

计算机视觉与模式识别 2017-05-09 v1

摘要

深度卷积网络在图像识别方面已取得巨大成功。然而,对于视频中的动作识别,其相对于传统方法的优势并不那么明显。我们提出了一种通用且灵活的视频级框架,用于学习视频中的动作模型。该方法称为时间段网络(TSN),旨在利用一种基于片段的采样与聚合模块对长范围时间结构建模。这一独特设计使我们的TSN能够通过使用整个动作视频高效地学习动作模型。学习到的模型可分别通过简单的平均池化与多尺度时间窗口集成,轻易适配于修剪后和未修剪视频中的动作识别。我们还研究了一系列在有限训练样本下实例化TSN框架的良好实践。我们的方法在四个具有挑战性的动作识别基准上取得了最先进的性能:HMDB51(71.0%)、UCF101(94.9%)、THUMOS14(80.1%)和ActivityNet v1.2(89.6%)。使用提出的RGB差分用于运动模型,我们的方法在UCF101(91.0%)上仍能取得具有竞争力的准确率,同时以340 FPS运行。此外,基于时间段网络,我们在2016年ActivityNet挑战赛的视频分类赛道上从24支队伍中获胜,这证明了TSN及所提出良好实践的有效性。

关键词

引用

@article{arxiv.1705.02953,
  title  = {Temporal Segment Networks for Action Recognition in Videos},
  author = {Limin Wang and Yuanjun Xiong and Zhe Wang and Yu Qiao and Dahua Lin and Xiaoou Tang and Luc Van Gool},
  journal= {arXiv preprint arXiv:1705.02953},
  year   = {2017}
}

备注

14 pages. An extension of submission at https://arxiv.org/abs/1608.00859