跨架构自监督视频表征学习
计算机视觉与模式识别
2022-05-27 v1
摘要
本文提出一种用于自监督视频表征学习的跨架构对比学习(CACL)新框架。CACL由一个3D CNN和一个视频transformer组成,二者并行使用以生成多样的对比学习正样本对,使模型能从这些多样而有意义的样本对中学习强表征。此外,我们引入一个时间自监督学习模块,能显式预测两个视频序列在时间顺序上的编辑距离(Edit distance)。这使模型学到丰富的时间表征,对CACL学到的视频级表征形成有力补充。我们在UCF101和HMDB51数据集上的视频检索与动作识别任务评估了该方法,其性能优异,大幅超越VideoMoCo和MoCo+BE等最先进方法。代码发布于https://github.com/guoshengcv/CACL。
引用
@article{arxiv.2205.13313,
title = {Cross-Architecture Self-supervised Video Representation Learning},
author = {Sheng Guo and Zihua Xiong and Yujie Zhong and Limin Wang and Xiaobo Guo and Bing Han and Weilin Huang},
journal= {arXiv preprint arXiv:2205.13313},
year = {2022}
}
备注
Accepted to CVPR2022