中文

基于帧间-帧内对比框架的自监督视频表示学习

计算机视觉与模式识别 2020-08-13 v2

摘要

我们提出一种自监督方法以从视频中学习特征表示。传统自监督方法的标准做法使用正负数据对,以对比学习策略进行训练。在此情形下,同一视频的不同模态被视为正样本,而来自不同视频的片段被视为负样本。由于时空信息对视频表示十分重要,我们通过引入帧内负样本扩展负样本,这些样本由同一锚定视频通过打破视频片段中的时间关系变换而来。借助所提出的帧间-帧内对比(IIC)框架,我们可训练时空卷积网络以学习视频表示。我们的 IIC 框架具有多种灵活配置,我们使用若干不同配置进行了实验。评估使用所学视频表示在视频检索与视频识别任务上进行。我们提出的 IIC 大幅优于当前最先进结果,例如在 UCF101 与 HMDB51 数据集上视频检索的 top-1 准确率分别提升 16.7% 和 9.5% 个百分点。对于视频识别,在这两个基准数据集上亦可获得提升。代码见 https://github.com/BestJuly/Inter-intra-video-contrastive-learning。

关键词

引用

@article{arxiv.2008.02531,
  title  = {Self-supervised Video Representation Learning Using Inter-intra Contrastive Framework},
  author = {Li Tao and Xueting Wang and Toshihiko Yamasaki},
  journal= {arXiv preprint arXiv:2008.02531},
  year   = {2020}
}

备注

Accepted by ACMMM 2020. Our project page is at https://bestjuly.github.io/Inter-intra-video-contrastive-learning/