面向运动的视频表征对比学习
计算机视觉与模式识别
2022-01-12 v1
摘要
运动作为视频中最显著、随时间变化的现象,对视频表征学习的发展具有独特而关键的作用。在本文中,我们提出一个问题:运动对于自监督视频表征学习究竟有多重要。为此,我们在对比学习框架下,将利用运动进行数据增强与特征学习二者协同结合。具体而言,我们提出一种面向运动的对比学习(Motion-focused Contrastive Learning, MCL)方法,以这种协同作为基础。一方面,MCL利用视频中每帧的光流,在时间和空间上采样管状片段(即跨时间的关联帧块序列)作为数据增强。另一方面,MCL进一步从空间、时间以及时空视角将卷积层的梯度图与光流图对齐,从而将运动信息锚定在特征学习中。在R(2+1)D骨干网络上进行的广泛实验证明了我们MCL的有效性。在UCF101上,基于MCL所学表征训练的线性分类器达到了81.91%的top-1准确率,比ImageNet有监督预训练高出6.78%。在Kinetics-400上,MCL在线性协议下达到了66.62%的top-1准确率。代码见 https://github.com/YihengZhang-CV/MCL-Motion-Focused-Contrastive-Learning。
引用
@article{arxiv.2201.04029,
title = {Motion-Focused Contrastive Learning of Video Representations},
author = {Rui Li and Yiheng Zhang and Zhaofan Qiu and Ting Yao and Dong Liu and Tao Mei},
journal= {arXiv preprint arXiv:2201.04029},
year = {2022}
}
备注
ICCV 2021 (Oral); Code is publicly available at: https://github.com/YihengZhang-CV/MCL-Motion-Focused-Contrastive-Learning