中文

通过节奏预测的自监督视频表征学习

计算机视觉与模式识别 2020-09-07 v2

摘要

本文从一新视角——视频节奏预测——解决自监督视频表征学习问题。其源于如下观察:人类视觉系统对视频节奏敏感,例如慢动作这一电影制作中的广泛使用技术。具体而言,给定以自然节奏播放的视频,我们以不同节奏随机采样训练片段,并要求神经网络识别每个视频片段的节奏。此处假设是,网络只有理解了底层视频内容并学习到具有代表性的时空特征,才能在此节奏推理任务中成功。此外,我们进一步引入对比学习,通过最大化相似视频内容上的一致性,推动模型区分不同节奏。为验证所提方法的有效性,我们使用若干替代网络架构在动作识别与视频检索任务上进行了大量实验。实验评估表明,我们的方法在不同网络架构与不同基准上均取得了自监督视频表征学习的当前最优(state-of-the-art)性能。代码与预训练模型可在 https://github.com/laura-wang/video-pace 获取。

关键词

引用

@article{arxiv.2008.05861,
  title  = {Self-supervised Video Representation Learning by Pace Prediction},
  author = {Jiangliu Wang and Jianbo Jiao and Yun-Hui Liu},
  journal= {arXiv preprint arXiv:2008.05861},
  year   = {2020}
}

备注

Correct some typos;Update some cocurent works accepted by ECCV 2020