中文

用于自监督表示学习的视频三维采样

计算机视觉与模式识别 2021-07-09 v1

摘要

现有大多数视频自监督方法主要利用视频的时间信号,忽略了运动物体的语义与环境信息对视频相关任务同样关键。本文提出一种新颖的视频表示学习自监督方法,称为视频三维采样(Video 3D Sampling, V3S)。为充分利用视频所提供的(空间与时间)信息,我们从三个维度(宽、高、时间)对视频进行预处理。由此,我们可以利用空间信息(物体尺寸)、时间信息(运动的方向与大小)作为学习目标。在实现中,我们结合三个维度的采样,并分别提出空间与时间上的尺度与投影变换。实验结果表明,当应用于动作识别、视频检索与动作相似性标注时,我们的方法以显著优势超越了现有最优水平(state-of-the-art)。

关键词

引用

@article{arxiv.2107.03578,
  title  = {Video 3D Sampling for Self-supervised Representation Learning},
  author = {Wei Li and Dezhao Luo and Bo Fang and Yu Zhou and Weiping Wang},
  journal= {arXiv preprint arXiv:2107.03578},
  year   = {2021}
}

备注

9 pages, 5 figures, 6 tables