HVM-1:使用近5000小时人类式视频数据预训练的大规模视频模型
计算机视觉与模式识别
2024-07-26 v1 机器学习
神经与进化计算
神经元与认知
摘要
我们介绍人类式视频模型(Human-like Video Models, HVM-1),使用近5000小时精选的人类式视频数据(主要为第一人称、持续的时空扩展视频录制),采用时空掩码自编码器(ST-MAE)算法进行预训练。我们发布了两个参数量为6.33亿的模型,分别在224x224和448x448像素的空间分辨率下进行训练。在下游few-shot视频和图像识别任务中评估这些模型的性能,并与使用来自YouTube(Kinetics-700)中1330小时短片动作导向视频剪辑预训练的模型进行比较。尽管相应预训练数据集的时空特征存在显著差异,HVM-1模型在下游评估中仍能与Kinetics-700预训练模型保持竞争力。HVM-1模型还学习了比使用相同数据进行图像-based MAE算法预训练的模型更准确、更稳健的对象表示,表明学习自然视频中时序规律的潜在优势。
关键词
引用
@article{arxiv.2407.18067,
title = {HVM-1: Large-scale video models pretrained with nearly 5000 hours of human-like video data},
author = {A. Emin Orhan},
journal= {arXiv preprint arXiv:2407.18067},
year = {2024}
}
备注
10 pages, 5 figures, 1 table; code & models available from https://github.com/eminorhan/hvm-1