中文

Skip-Clip:基于未来片段顺序排序的自监督时空表征学习

计算机视觉与模式识别 2019-10-29 v1

摘要

深度神经网络需要收集并标注大量数据才能成功训练。为缓解标注瓶颈,我们提出一种新颖的自监督表征学习方法,用于从视频中提取的时空特征。我们引入 Skip-Clip,该方法利用视频中的时间相干性,通过训练一个深度模型在给定上下文片段的条件下进行未来片段顺序排序,作为视频未来预测的替代目标。我们表明,使用该方法学习到的特征具有泛化性,并能强迁移至下游任务。在 UCF101 数据集上的动作识别中,相较随机初始化我们获得了 51.8% 的提升,并优于使用 inflated ImageNet 参数初始化的模型。Skip-Clip 还取得了与最先进自监督方法相竞争的结果。

关键词

引用

@article{arxiv.1910.12770,
  title  = {Skip-Clip: Self-Supervised Spatiotemporal Representation Learning by Future Clip Order Ranking},
  author = {Alaaeldin El-Nouby and Shuangfei Zhai and Graham W. Taylor and Joshua M. Susskind},
  journal= {arXiv preprint arXiv:1910.12770},
  year   = {2019}
}

备注

Holistic Video Understanding Workshop ICCV2019