关于上下文自监督视频表示学习的大规模分析
计算机视觉与模式识别
2025-04-09 v1
摘要
自监督学习已成为无标签模型预训练的强大范例,尤其在视频领域,因为手动标注成本高昂且耗时。然而,现有的自监督方法采用多样化的实验设置,由于缺乏标准化基准,使直接比较具有挑战性。本文建立了一个统一的基准,使不同方法之间的公平比较成为可能。此外,我们系统性地研究了视频自监督学习中的五个关键方面:(1)数据集规模、(2)模型复杂度、(3)数据分布、(4)数据噪声、(5)特征表示。为促进这一研究,我们在五个基准数据集上评估了六种自监督学习方法,涵盖六种网络架构,并在两个不同的下游任务上进行评估。我们的分析揭示了预训练策略、数据集特征、预文本任务和模型架构之间的关键洞见。此外,我们将这些发现扩展到视频基础模型(ViFMs),展示了其在大规模视频表示学习中的相关性。最后,依据这些见解,我们提出了一种显著减少训练数据需求的方法,超越依赖更多10%预训练数据的领先方法。我们相信本工作将指导未来研究,深入理解视频自监督表示学习及其更广泛的含义。
引用
@article{arxiv.2504.06153,
title = {A Large-Scale Analysis on Contextual Self-Supervised Video Representation Learning},
author = {Akash Kumar and Ashlesha Kumar and Vibhav Vineet and Yogesh S Rawat},
journal= {arXiv preprint arXiv:2504.06153},
year = {2025}
}
备注
CVPR'25 Workshop: 6th Data-Efficient Workshop