用于自监督时空学习的视频完形填空程序
计算机视觉与模式识别
2020-01-03 v1
摘要
我们提出一种新颖的自监督方法,称为视频完形填空程序(VCP),以学习丰富的时空表征。VCP 首先通过保留视频片段生成“空白”,然后通过对被保留片段施加时空操作来创建“选项”。最后,用“选项”填充“空白”,并通过预测施加于片段上的操作类别来学习表征。VCP 在自监督学习中既可充当代理任务,也可充当目标任务。作为代理任务,它将丰富的自监督表征转化为视频片段操作(选项),从而增强灵活性并降低表征学习的复杂度。作为目标任务,它能以统一且可解释的方式评估已学习的表征模型。利用 VCP,我们训练时空表征模型(3D-CNNs)并将此类模型应用于动作识别与视频检索任务。在常用基准上的实验表明,所训练模型以显著优势超越最先进的自监督模型。
引用
@article{arxiv.2001.00294,
title = {Video Cloze Procedure for Self-Supervised Spatio-Temporal Learning},
author = {Dezhao Luo and Chang Liu and Yu Zhou and Dongbao Yang and Can Ma and Qixiang Ye and Weiping Wang},
journal= {arXiv preprint arXiv:2001.00294},
year = {2020}
}
备注
AAAI2020(Oral)