VideoUFO:面向用户关注的百万规模文本到视频生成数据集
计算机视觉与模式识别
2025-05-14 v2
摘要
文本到视频生成模型将文本提示转换为动态视觉内容,具有在电影制作、游戏和教育等领域广泛应用的潜力。然而,这些模型的实际性能往往不足以满足用户期望。一个关键原因是这些模型未在与用户想要创建的主题相关的视频上进行训练。本文提出 VideoUFO,首个专为契合用户在现实场景中的关注点而打造的视频数据集。此外,VideoUFO 还具备:(1)与现有视频数据集几乎无重叠(仅 0.29%),(2)通过 YouTube 官方 API 按创意公共许可证检索的视频。这两个属性为未来研究者提供了更大的自由度,以拓宽训练数据来源。VideoUFO 包含超过 109 万个视频片段,每个片段配有简短和详细的描述文本。具体而言,通过聚类,我们首先从百万规模的真实文本到视频提示数据集 VidProM 中识别出 1291 个用户关注主题。随后,我们利用这些主题从 YouTube 检索视频,将检索到的视频切分为片段,并为每个片段生成简短和详细的描述文本。经核查后,最终得到约 109 万个符合主题的视频片段。我们的实验表明:(1)当前 16 个文本到视频模型在所有用户关注主题上表现不一致;(2)在最差表现主题上,基于 VideoUFO 训练的简单模型可超越其他模型。数据集和代码已公开于 https://huggingface.co/datasets/WenhaoWang/VideoUFO 和 https://github.com/WangWenhao0716/BenchUFO,遵循 CC BY 4.0 许可证。
引用
@article{arxiv.2503.01739,
title = {VideoUFO: A Million-Scale User-Focused Dataset for Text-to-Video Generation},
author = {Wenhao Wang and Yi Yang},
journal= {arXiv preprint arXiv:2503.01739},
year = {2025}
}