中文

ASCNet:基于表观-速度一致性的自监督视频表征学习

计算机视觉与模式识别 2021-08-18 v2

摘要

我们研究自监督视频表征学习,这是一项具有挑战性的任务,原因在于:1)缺乏用于显式监督的标签;2)非结构化且含噪的视觉信息。现有方法主要使用对比损失以视频片段作为实例,并通过区分不同实例学习视觉表征,但它们需要谨慎处理负样本对,要么依赖大批量大小、记忆库、额外模态或定制挖掘策略,这不可避免地引入噪声数据。本文中,我们观察到正样本间的一致性为学习鲁棒视频表征的关键。具体而言,我们提出两项任务分别学习表观一致性与速度一致性。表观一致性任务旨在最大化同一视频不同播放速度的两片段间的相似性。速度一致性任务旨在最大化相同播放速度但不同表观信息的两片段间的相似性。我们表明联合优化两项任务持续提升下游任务(如动作识别与视频检索)性能。值得注意的是,在 UCF-101 数据集上的动作识别中,我们在无额外模态或负样本对的无监督预训练下取得 90.8\% 准确率,优于 ImageNet 有监督预训练模型。代码与模型将公开。

关键词

引用

@article{arxiv.2106.02342,
  title  = {ASCNet: Self-supervised Video Representation Learning with Appearance-Speed Consistency},
  author = {Deng Huang and Wenhao Wu and Weiwen Hu and Xu Liu and Dongliang He and Zhihua Wu and Xiangmiao Wu and Mingkui Tan and Errui Ding},
  journal= {arXiv preprint arXiv:2106.02342},
  year   = {2021}
}

备注

Accepted to ICCV2021