中文

HVM-1:使用近5000小时人类式视频数据预训练的大规模视频模型

计算机视觉与模式识别 2024-07-26 v1 机器学习 神经与进化计算 神经元与认知

摘要

我们介绍人类式视频模型(Human-like Video Models, HVM-1),使用近5000小时精选的人类式视频数据(主要为第一人称、持续的时空扩展视频录制),采用时空掩码自编码器(ST-MAE)算法进行预训练。我们发布了两个参数量为6.33亿的模型,分别在224x224和448x448像素的空间分辨率下进行训练。在下游few-shot视频和图像识别任务中评估这些模型的性能,并与使用来自YouTube(Kinetics-700)中1330小时短片动作导向视频剪辑预训练的模型进行比较。尽管相应预训练数据集的时空特征存在显著差异,HVM-1模型在下游评估中仍能与Kinetics-700预训练模型保持竞争力。HVM-1模型还学习了比使用相同数据进行图像-based MAE算法预训练的模型更准确、更稳健的对象表示,表明学习自然视频中时序规律的潜在优势。

关键词

引用

@article{arxiv.2407.18067,
  title  = {HVM-1: Large-scale video models pretrained with nearly 5000 hours of human-like video data},
  author = {A. Emin Orhan},
  journal= {arXiv preprint arXiv:2407.18067},
  year   = {2024}
}

备注

10 pages, 5 figures, 1 table; code & models available from https://github.com/eminorhan/hvm-1