中文

基于Odd-One-Out网络的自监督视频表示学习

计算机视觉与模式识别 2017-04-06 v4

摘要

我们提出了一种新的自监督CNN预训练技术,该技术基于一种名为“odd-one-out learning”的新颖辅助任务。在此任务中,机器被要求从一组原本相关的元素中识别出不相关或异常的元素。我们将此技术应用于自监督视频表示学习,其中我们从视频中采样子序列,并要求网络学习预测异常视频子序列。异常视频子序列的采样方式使其具有错误的帧时间顺序,而正常子序列具有正确的时间顺序。因此,生成odd-one-out问题不需要人工标注。我们的学习机器实现为多流卷积神经网络,并进行端到端学习。使用odd-one-out网络,我们学习视频的时间表示,这些表示可泛化到其他相关任务,如动作识别。在动作分类上,我们的方法在UCF101数据集上仅使用UCF101数据进行训练即获得了60.3%的准确率,比当前state-of-the-art自监督学习方法高出约10%。类似地,在HMDB51数据集上,我们在动作分类任务上比自监督state-of-the-art方法高出12.7%。

关键词

引用

@article{arxiv.1611.06646,
  title  = {Self-Supervised Video Representation Learning With Odd-One-Out Networks},
  author = {Basura Fernando and Hakan Bilen and Efstratios Gavves and Stephen Gould},
  journal= {arXiv preprint arXiv:1611.06646},
  year   = {2017}
}

备注

Accepted in In IEEE International Conference on Computer Vision and Pattern Recognition CVPR 2017