中文

回到未来:用于自监督对比视频表征学习的循环编码预测

计算机视觉与模式识别 2021-10-26 v5

摘要

本文表明,在视频特征空间中使时间循环具有最大可预测性有益于动作分类。具体而言,我们提出一种称为循环编码预测(CEP)的新颖学习方法,能够有效表示无标签视频内容的高级时空结构。CEP 构建一个潜在空间,其中闭合的前向-后向以及后向-前向时间循环的概念被近似保留。作为一种自监督信号,CEP 利用视频流的双向时间一致性,并应用损失函数以鼓励时间循环闭合与对比特征分离。在架构上,底层网络结构对所有视频片段使用单一特征编码器,并添加两个学习时间前向与后向转移的预测模块。我们将该框架应用于动作识别任务的网络预训练。我们在标准数据集 UCF101 与 HMDB51 上报告了显著改进的结果。详细的消融研究支持了所提组件的有效性。本文随附完整发布 CEP 组件的源代码。

关键词

引用

@article{arxiv.2010.07217,
  title  = {Back to the Future: Cycle Encoding Prediction for Self-supervised Contrastive Video Representation Learning},
  author = {Xinyu Yang and Majid Mirmehdi and Tilo Burghardt},
  journal= {arXiv preprint arXiv:2010.07217},
  year   = {2021}
}

备注

accepted at BMVC