在未剪辑视频中探索关系以进行自监督学习
计算机视觉与模式识别
2020-08-07 v1
摘要
现有的视频自监督学习方法主要依赖剪辑后视频进行模型训练。然而,剪辑数据集是从未剪辑视频中人工标注得到的。从这个意义上说,这些方法并非真正的自监督。本文提出一种新颖的自监督方法,称为在未剪辑视频中探索关系(ERUV),它可直接应用于未剪辑视频(真实无标签)以学习时空特征。ERUV 首先通过镜头切换检测生成单镜头视频。随后使用一种设计的采样策略为视频片段建模关系,该策略被保存为我们的自监督信号。最后,网络通过预测视频片段间关系类别来学习表示。ERUV 能够比较视频的异同,这也是动作与视频相关任务的重要步骤。我们使用三类 3D CNN,通过动作识别与视频检索任务验证所学模型。实验结果表明,ERUV 能够学习更丰富的表示,并以显著优势超越最先进的自监督方法。
引用
@article{arxiv.2008.02711,
title = {Exploring Relations in Untrimmed Videos for Self-Supervised Learning},
author = {Dezhao Luo and Bo Fang and Yu Zhou and Yucan Zhou and Dayan Wu and Weiping Wang},
journal= {arXiv preprint arXiv:2008.02711},
year = {2020}
}