中文

重新评估现成时间建模方法在大规模视频分类中的有效性

计算机视觉与模式识别 2017-08-15 v1

摘要

本文描述了我们在 ActivityNet Kinetics 挑战赛视频识别任务中获得第一名的解决方案。现有大多数最先进的视频识别方法倾向于端到端的流程。DevNet 框架是一个例外。DevNet 的优点在于它首先使用视频数据来学习一个网络(即微调或从头训练)。它不直接使用端到端的分类分数(如 softmax 分数),而是从学习到的网络中提取特征,然后将其输入到现成的机器学习模型中以进行视频分类。然而,这条研究路线的有效性长期以来一直被忽视和低估。在本次提交中,我们广泛使用了这一策略。具体而言,我们研究了四种使用学习到的特征的时间建模方法:多组移位注意力网络、时间 Xception 网络、多流序列模型和快进序列模型。在具有挑战性的 Kinetics 数据集上的实验结果表明,我们提出的时间建模方法能够显著改进现有的大规模视频识别任务中的方法。最值得注意的是,我们最佳的单个多组移位注意力网络在验证集上的 top-1 准确率达到 77.7%,top-5 准确率达到 93.2%。

关键词

引用

@article{arxiv.1708.03805,
  title  = {Revisiting the Effectiveness of Off-the-shelf Temporal Modeling Approaches for Large-scale Video Classification},
  author = {Yunlong Bian and Chuang Gan and Xiao Liu and Fu Li and Xiang Long and Yandong Li and Heng Qi and Jie Zhou and Shilei Wen and Yuanqing Lin},
  journal= {arXiv preprint arXiv:1708.03805},
  year   = {2017}
}

备注

A brief summary of the winner solution on Activity Kinetics challenge 2017