中文

用于自监督视频识别的帧间-帧内变体双重表示

计算机视觉与模式识别 2021-10-26 v3 人工智能

摘要

应用于自监督表示学习的对比学习在深度模型中再度兴起。在本文中,我们发现现有的基于对比学习的自监督视频识别方案侧重于帧间方差编码,却忽略了同一视频内片段存在的帧内方差。因此我们提出为每个片段学习双重表示,其(I)通过打乱排序 pretext 任务编码帧内方差;(II)通过时间相干对比损失编码帧间方差。实验结果表明,我们的方法在平衡帧间与帧内方差方面起着关键作用,并在多个骨干网络和对比学习框架上带来一致的性能提升。与SimCLR结合并在Kinetics-400上预训练,我们的方法在UCF101和HMDB51测试集上分别取得 82.0%\textbf{82.0\%}51.2%\textbf{51.2\%} 的下游分类准确率,以及在UCF101上 46.1%\textbf{46.1\%} 的视频检索准确率,优于基于pretext任务和基于对比学习的同类方法。我们的代码可在 \href{https://github.com/lzhangbj/DualVar}{https://github.com/lzhangbj/DualVar} 获取。

关键词

引用

@article{arxiv.2107.01194,
  title  = {Inter-intra Variant Dual Representations forSelf-supervised Video Recognition},
  author = {Lin Zhang and Qi She and Zhengyang Shen and Changhu Wang},
  journal= {arXiv preprint arXiv:2107.01194},
  year   = {2021}
}

备注

Accepted by BMVC 2021