中文

LVD-2M:带有时序稠密描述的长时段视频数据集

计算机视觉与模式识别 2024-10-15 v1 人工智能 机器学习

摘要

视频生成模型的效果严重依赖其训练数据集的质量。大多数以往的视频生成模型都在短视频剪辑上进行训练,而近期越来越多的人关注直接在更长的视频上进行训练。然而,缺乏高质量的长视频数据集 impedes(阻碍)了长视频生成的进步。为推动长视频生成研究,我们希望获得一个具有四项关键特征的新型数据集:(1)视频时长至少 10 秒,(2)为长时段无剪辑的视频(long-take),(3)包含大量运动和多样化内容,(4)具备时序稠密描述。为实现此目标,我们引入了一套用于筛选高质量长时段视频并生成时序稠密描述的管道。具体而言,我们定义了一组量化评估视频质量的指标,包括场景剪辑、动态程度和语义层面的质量,从而从大量源视频中筛选出高质量的长时段无剪辑视频。随后,我们开发了分层视频描述管道,用于为长视频生成时序稠密描述。通过该管道,我们策划了首个长时段无剪辑视频数据集 LVD-2M,包含 200 万段时长超过 10 秒的长时段视频,每段都配有时序稠密描述。我们进一步通过在 LVD-2M 上微调视频生成模型来验证其有效性,实现对具有动态运动的长视频的生成。我们相信,本工作将显著促进未来在长视频生成方面的研究。

关键词

引用

@article{arxiv.2410.10816,
  title  = {LVD-2M: A Long-take Video Dataset with Temporally Dense Captions},
  author = {Tianwei Xiong and Yuqing Wang and Daquan Zhou and Zhijie Lin and Jiashi Feng and Xihui Liu},
  journal= {arXiv preprint arXiv:2410.10816},
  year   = {2024}
}

备注

NeurIPS 2024 Dataset and Benchmark Track. Project page: https://silentview.github.io/LVD-2M/ . Code: https://github.com/SilentView/LVD-2M