中文

基于视频旋转预测的自监督时空特征学习

计算机视觉与模式识别 2019-04-05 v2

摘要

深度神经网络的成功通常需要大量标注训练数据,这代价高昂且难以规模化,尤其对于视频数据。为缓解该问题,本文提出3DRotNet:一种从无标注视频中学习时空特征的全自监督方法。对全部视频施加一组旋转,并将预测这些旋转定义为前置任务。在完成该任务时,3DRotNet实际上被训练以理解视频中的语义概念与运动。换言之,它学习了时空视频表示,可迁移用于提升小数据集上的视频理解任务。我们的大量实验成功证明了所提框架在动作识别上的有效性,相较最先进的自监督方法取得显著改进。利用大数据集上自监督预训练的3DRotNet,识别准确率在UCF101上提升20.4%,在HMDB51上提升16.7%,优于从头训练的模型。

关键词

引用

@article{arxiv.1811.11387,
  title  = {Self-Supervised Spatiotemporal Feature Learning via Video Rotation Prediction},
  author = {Longlong Jing and Xiaodong Yang and Jingen Liu and Yingli Tian},
  journal= {arXiv preprint arXiv:1811.11387},
  year   = {2019}
}