用于自监督表示学习的视频三维采样
计算机视觉与模式识别
2021-07-09 v1
摘要
现有大多数视频自监督方法主要利用视频的时间信号,忽略了运动物体的语义与环境信息对视频相关任务同样关键。本文提出一种新颖的视频表示学习自监督方法,称为视频三维采样(Video 3D Sampling, V3S)。为充分利用视频所提供的(空间与时间)信息,我们从三个维度(宽、高、时间)对视频进行预处理。由此,我们可以利用空间信息(物体尺寸)、时间信息(运动的方向与大小)作为学习目标。在实现中,我们结合三个维度的采样,并分别提出空间与时间上的尺度与投影变换。实验结果表明,当应用于动作识别、视频检索与动作相似性标注时,我们的方法以显著优势超越了现有最优水平(state-of-the-art)。
引用
@article{arxiv.2107.03578,
title = {Video 3D Sampling for Self-supervised Representation Learning},
author = {Wei Li and Dezhao Luo and Bo Fang and Yu Zhou and Weiping Wang},
journal= {arXiv preprint arXiv:2107.03578},
year = {2021}
}
备注
9 pages, 5 figures, 6 tables