中文

MiraData:一个大规模视频数据集,拥有长时长与结构化描述

计算机视觉与模式识别 2024-07-10 v1

摘要

Sora 的高动作强度和持续时间长的视频显著性地影响了视频生成领域,吸引了前所未有的关注。然而,现有的公开数据集不足以生成类似 Sora 的视频,因为它们主要包含短时长、低动作强度和简短描述的视频。为此,我们提出 MiraData,一个在视频时长、描述细节、动作强度和视觉质量方面超越前人的数据集。我们从多样化且精心挑选的来源精选数据,并细致加工以获得语义一致的片段。采用 GPT-4V 为结构化描述提供注释,包括来自四个不同视角的详细描述以及一个概括性密集描述。为更好地评估视频生成中的时间一致性和动作强度,我们引入 MiraBench,通过添加 3D 一致性和基于跟踪的动作强度指标来增强现有基准。MiraBench 包括 150 个评估提示和 17 项指标,涵盖时间一致性、动作强度、3D 一致性、视觉质量、文本-视频对齐以及分布相似性。为展示 MiraData 的实用性与有效性,我们使用基于 DiT 的视频生成模型 MiraDiT 进行实验。在 MiraBench 上的实验结果表明,MiraData 在动作强度方面尤为优越。

关键词

引用

@article{arxiv.2407.06358,
  title  = {MiraData: A Large-Scale Video Dataset with Long Durations and Structured Captions},
  author = {Xuan Ju and Yiming Gao and Zhaoyang Zhang and Ziyang Yuan and Xintao Wang and Ailing Zeng and Yu Xiong and Qiang Xu and Ying Shan},
  journal= {arXiv preprint arXiv:2407.06358},
  year   = {2024}
}