中文

RSPNet:面向无监督视频表示学习的相对速度感知

计算机视觉与模式识别 2021-03-16 v2

摘要

我们研究无监督视频表示学习,旨在仅从未经标注的视频中学习运动与表观特征,并可复用于动作识别等下游任务。然而,该任务极具挑战性,原因有二:1)视频中高度复杂的时空信息;2)缺乏用于训练的标注数据。与静态图像表示学习不同,难以构造合适的自监督任务来良好建模运动与表观特征。近来,已有若干尝试通过视频播放速度预测来学习视频表示。但为视频获取精确速度标签并非易事。更关键的是,所学模型可能倾向于关注运动模式,从而无法学好表观特征。本文中,我们观察到相对播放速度与运动模式更为一致,因而可为表示学习提供更有效且稳定的监督。因此,我们提出一种感知播放速度的新方法,并利用两段视频片段间的相对速度作为标签。以此方式,我们能够更好地感知速度并学习更优的运动特征。此外,为确保表观特征的学习,我们进一步提出以表观为中心的任务,强制模型感知两段视频片段间的表观差异。我们表明,联合优化这两个任务可持续提升两个下游任务(即动作识别与视频检索)的性能。值得注意的是,在UCF101数据集上,我们无需使用标注数据进行预训练即取得93.7%的准确率,优于ImageNet有监督预训练模型。代码与预训练模型见https://github.com/PeihaoChen/RSPNet。

关键词

引用

@article{arxiv.2011.07949,
  title  = {RSPNet: Relative Speed Perception for Unsupervised Video Representation Learning},
  author = {Peihao Chen and Deng Huang and Dongliang He and Xiang Long and Runhao Zeng and Shilei Wen and Mingkui Tan and Chuang Gan},
  journal= {arXiv preprint arXiv:2011.07949},
  year   = {2021}
}

备注

Accepted by AAAI-2021. Code and pre-trained models can be found at https://github.com/PeihaoChen/RSPNet