中文

时空对比视频表示学习

计算机视觉与模式识别 2021-04-07 v4 机器学习

摘要

我们提出了一种自监督的对比视频表示学习(CVRL)方法,从未标注视频中学习时空视觉表示。我们的表示使用对比损失进行学习,其中来自同一短视频的两个增广片段在嵌入空间中被拉近,而来自不同视频的片段被推远。我们研究了什么构成了良好的视频自监督学习数据增广,发现空间和时间信息都至关重要。我们精心设计了涉及空间和时间线索的数据增广。具体而言,我们提出了一种时间一致的空间增广方法,以对视频的每一帧施加强空间增广,同时保持跨帧的时间一致性。我们还提出了一种基于采样的时序增广方法,以避免对时间上相距较远的片段过度强制不变性。在 Kinetics-600 上,使用 CVRL 学习的表示训练的线性分类器以 3D-ResNet-50(R3D-50)为骨干实现了 70.4% 的 top-1 准确率,使用相同的 inflated R3D-50 时比 ImageNet 监督预训练高出 15.7%,比 SimCLR 无监督预训练高出 18.8%。CVRL 的性能可通过更大的 R3D-152(2倍滤波器)骨干进一步提升至 72.9%,显著缩小了无监督与有监督视频表示学习之间的差距。我们的代码和模型将发布于 https://github.com/tensorflow/models/tree/master/official/。

关键词

引用

@article{arxiv.2008.03800,
  title  = {Spatiotemporal Contrastive Video Representation Learning},
  author = {Rui Qian and Tianjian Meng and Boqing Gong and Ming-Hsuan Yang and Huisheng Wang and Serge Belongie and Yin Cui},
  journal= {arXiv preprint arXiv:2008.03800},
  year   = {2021}
}

备注

CVPR2021 Camera ready