通过生成式预训练学习长时段视频先验
计算机视觉与模式识别
2024-04-25 v1
摘要
长时段视频中涉及的概念,如人物、物体及其相互作用,可被视为遵循隐式先验。它们在综合学习方面尤为复杂且仍具挑战性。近年来,生成式预训练(GPT)在建模任何类型的文本内容甚至视觉位置方面展现出多样的能力。这种方法能否用于学习长时段视频先验?不如在像素空间上操作,利用视觉位置如边界框和关键点来表示视频中的关键信息,这些位置可以被简单离散化后进行标记以供GPT消耗。由于合适数据的稀缺,我们创建一个名为\textbf{Storyboard20K}的新数据集,从电影中收集,包含情节概述、逐帧关键帧以及细粒度的电影场景和人物注释,具有一致的ID、边界框和整体身体关键点。如此一来,长时段视频可由一组标记表示,并通过生成式预训练进行学习。实验结果验证了我们方法在学习长时段视频先验方面的巨大潜力。代码和数据将在\url{https://github.com/showlab/Long-form-Video-Prior}发布。
关键词
引用
@article{arxiv.2404.15909,
title = {Learning Long-form Video Prior via Generative Pre-Training},
author = {Jinheng Xie and Jiajun Feng and Zhaoxu Tian and Kevin Qinghong Lin and Yawen Huang and Xi Xia and Nanxu Gong and Xu Zuo and Jiaqi Yang and Yefeng Zheng and Mike Zheng Shou},
journal= {arXiv preprint arXiv:2404.15909},
year = {2024}
}