无监督时空表征学习的大规模研究
计算机视觉与模式识别
2021-04-30 v1 人工智能
机器学习
摘要
我们提出一项基于视频的无监督时空表征学习的大规模研究。通过对四种近期基于图像的框架的统一视角,我们研究了一个可轻松将所有这些方法推广到时空的简单目标。我们的目标鼓励同一视频中时间上持续的特征,且尽管简单,它在以下方面出奇地有效:(i) 不同无监督框架,(ii) 预训练数据集,(iii) 下游数据集,以及 (iv) 骨干架构。我们从该研究中得出一系列有趣的观察,例如,我们发现鼓励长跨度持续性即使时间跨度达 60 秒也有效。除在多个基准上取得最先进结果外,我们报告了若干有前景的案例,其中无监督预训练可优于其有监督对应方法。代码见 https://github.com/facebookresearch/SlowFast
引用
@article{arxiv.2104.14558,
title = {A Large-Scale Study on Unsupervised Spatiotemporal Representation Learning},
author = {Christoph Feichtenhofer and Haoqi Fan and Bo Xiong and Ross Girshick and Kaiming He},
journal= {arXiv preprint arXiv:2104.14558},
year = {2021}
}
备注
CVPR 2021