中文

ActionVLAD:用于动作分类的时空聚合学习

计算机视觉与模式识别 2017-04-11 v1

摘要

在这项工作中,我们引入了一种用于动作分类的新视频表示,该表示在视频的整个时空范围内聚合局部卷积特征。我们通过将最先进的双流网络与可学习的时空特征聚合相结合来实现这一点。由此产生的架构端到端可训练用于整视频分类。我们研究了跨空间和时间的池化以及组合来自不同流的信号的不同策略。我们发现:(i) 跨空间和时间联合池化很重要,但 (ii) 外观和运动流最好聚合到它们各自独立的表示中。最后,我们展示了我们的表示大幅优于双流基础架构(相对 13%)并且在 HMDB51、UCF101 和 Charades 视频分类基准上优于具有可比基础架构的其他基线。

关键词

引用

@article{arxiv.1704.02895,
  title  = {ActionVLAD: Learning spatio-temporal aggregation for action classification},
  author = {Rohit Girdhar and Deva Ramanan and Abhinav Gupta and Josef Sivic and Bryan Russell},
  journal= {arXiv preprint arXiv:1704.02895},
  year   = {2017}
}

备注

Accepted to CVPR 2017. Project page: https://rohitgirdhar.github.io/ActionVLAD/