中文

自监督视频表征学习的大规模分析

计算机视觉与模式识别 2023-11-22 v2

摘要

自监督学习是一种无需标签的模型预训练有效方式,尤其在标注昂贵的视频领域。视频领域现有的自监督工作使用不同的实验设置来证明其有效性,由于缺乏标准基准,跨方法的比较变得具有挑战性。在本文中,我们首先提供一个能够在相同基础上比较现有方法的基准。接着,我们研究对视频重要的自监督学习的五个方面:1) 数据集规模,2) 复杂度,3) 数据分布,4) 数据噪声,以及 5) 特征分析。为便于该研究,我们聚焦于七种不同的方法以及七种不同的网络架构,并在 5 个不同数据集上执行大量实验,评估两种不同的下游任务。我们给出了若干跨越预训练与目标数据集、 pretext-tasks 及模型架构等不同性质的有趣见解。我们进一步将其中部分见解付诸实际检验,并提出一种仅需有限训练数据且优于使用 10 倍预训练数据的现有 SOTA 方法的方法。我们相信该工作将为研究者更好理解视频表征学习中的自监督 pretext 任务铺平道路。

关键词

引用

@article{arxiv.2306.06010,
  title  = {A Large-Scale Analysis on Self-Supervised Video Representation Learning},
  author = {Akash Kumar and Ashlesha Kumar and Vibhav Vineet and Yogesh Singh Rawat},
  journal= {arXiv preprint arXiv:2306.06010},
  year   = {2023}
}