无需自然视频的视频表示学习
计算机视觉与模式识别
2024-11-20 v2
摘要
我们证明,可以从合成视频和自然图像中学习有用的视频表示,而无需在训练中引入自然视频。我们提出了一系列通过简单生成过程合成的视频数据集,这些数据集模拟了越来越多的自然视频特性(如运动、加速度和形状变换)。在这些生成数据集上预训练的视频模型的下游性能随数据集的推进而逐步提升。在我们的合成视频上预训练的 VideoMAE 模型在 UCF101 动作分类任务上弥补了从零训练与从自然视频自监督预训练之间 97.2% 的性能差距,并在 HMDB51 上超越了预训练模型。在预训练阶段引入静态图像裁剪后,在 UCF101 上获得了类似的性能,并在 UCF101-P 的14个分布外数据集中的11个上超越了 UCF101 预训练模型。通过分析数据集的低级属性,我们识别出帧多样性、帧与自然数据的相似度以及下游性能之间的相关性。我们的方法为预训练的视频数据整理过程提供了一种更具可控性和透明性的替代方案。
引用
@article{arxiv.2410.24213,
title = {Learning Video Representations without Natural Videos},
author = {Xueyang Yu and Xinlei Chen and Yossi Gandelsman},
journal= {arXiv preprint arXiv:2410.24213},
year = {2024}
}
备注
Project page: https://unicorn53547.github.io/video_syn_rep/