中文

跨架构自监督视频表征学习

计算机视觉与模式识别 2022-05-27 v1

摘要

本文提出一种用于自监督视频表征学习的跨架构对比学习(CACL)新框架。CACL由一个3D CNN和一个视频transformer组成,二者并行使用以生成多样的对比学习正样本对,使模型能从这些多样而有意义的样本对中学习强表征。此外,我们引入一个时间自监督学习模块,能显式预测两个视频序列在时间顺序上的编辑距离(Edit distance)。这使模型学到丰富的时间表征,对CACL学到的视频级表征形成有力补充。我们在UCF101和HMDB51数据集上的视频检索与动作识别任务评估了该方法,其性能优异,大幅超越VideoMoCo和MoCo+BE等最先进方法。代码发布于https://github.com/guoshengcv/CACL。

关键词

引用

@article{arxiv.2205.13313,
  title  = {Cross-Architecture Self-supervised Video Representation Learning},
  author = {Sheng Guo and Zihua Xiong and Yujie Zhong and Limin Wang and Xiaobo Guo and Bing Han and Weilin Huang},
  journal= {arXiv preprint arXiv:2205.13313},
  year   = {2022}
}

备注

Accepted to CVPR2022