无数据收集的掩码视频建模
计算机视觉与模式识别
2024-09-11 v1
摘要
预训练视频变换器通常需要大量数据,带来了数据收集成本高、隐私、授权及固有偏见等方面的显著挑战。从合成数据生成数据是解决这些问题的有前景的方法之一,但仅基于合成数据进行预训练也存在自身挑战。本文引入一种有效的自监督学习框架,用于视频数据,利用可轻易获取且成本较低的静态图像。具体而言,我们定义了伪运动生成器(PMG)模块,通过递归应用图像变换来生成由静态图像构成的伪运动视频。这些伪运动视频随后被用于掩码视频建模。该方法适用于合成图像,从而彻底摆脱数据收集成本及其他现实数据相关问题。通过在动作识别任务上的实验,我们展示了该框架通过伪运动视频能够有效学习时空特征,显著优于现有方法(这些方法也使用静态图像),并在使用真实与合成视频的情况下部分超越。这些结果揭示了通过掩码视频建模,视频变换器到底学习了什么片段。
引用
@article{arxiv.2409.06665,
title = {Data Collection-free Masked Video Modeling},
author = {Yuchi Ishikawa and Masayoshi Kondo and Yoshimitsu Aoki},
journal= {arXiv preprint arXiv:2409.06665},
year = {2024}
}
备注
ECCV 2024