OpenVid-1M:用于文本到视频生成的大规模高质量数据集
计算机视觉与模式识别
2025-02-14 v3
摘要
文本到视频(T2V)生成近期因大型多模态模型 Sora 而引起广泛关注。然而,T2V 生成仍面临两个重要挑战:1)缺乏精确的开源高质量数据集。以往流行的视频数据集,如 WebVid-10M 和 Panda-70M,要么质量较低,要么规模过大,难以供大多数研究机构使用。因此,为 T2V 生成收集精确的高质量文本-视频配对具有具有挑战性且至关重要。2)未充分利用文本信息。近期的 T2V 方法主要关注视觉 Transformer,仅使用简单的注意力模块进行视频生成,未能充分提取文本提示中的语义信息。为解决上述问题,我们引入 OpenVid-1M,一个包含超过 100 万条文本-视频配对的精确高质量数据集,包含富有表现力的标题。该开放场景数据集促进了 T2V 生成的研究。此外,我们从 OpenVid-1M 中挑选出 43.3 万条 1080p 视频,创建了 OpenVidHD-0.4M,推动了高清视频生成。此外,我们提出了一种新型多模态视频扩散转换器(MVDiT),能够从视觉标记中挖掘结构信息,并从文本标记中挖掘语义信息。大量实验和消融研究验证了 OpenVid-1M 优于以往数据集的优势以及 MVDiT 的有效性。
关键词
引用
@article{arxiv.2407.02371,
title = {OpenVid-1M: A Large-Scale High-Quality Dataset for Text-to-video Generation},
author = {Kepan Nan and Rui Xie and Penghao Zhou and Tiehan Fan and Zhenheng Yang and Zhijie Chen and Xiang Li and Jian Yang and Ying Tai},
journal= {arXiv preprint arXiv:2407.02371},
year = {2025}
}
备注
20 pages, 15 figures, Published as a conference paper at ICLR 2025