VidGen-1M:用于文本到视频生成的大规模数据集
计算机视觉与模式识别
2024-08-06 v1
摘要
视频-文本对的质量决定了文本到视频模型的上限。当前用于训练这些模型的数据集存在显著不足,包括低的时间一致性、质量较差的标题、视频质量不佳以及数据分布不平衡。依赖图像模型进行标记和基于手动规则的精选的现行视频策划过程导致计算负荷高昂,并留下杂乱数据。结果是缺乏适合文本到视频模型的合适训练数据集。为了解决这个问题,我们提出了 VidGen-1M,一个优越的文本到视频模型训练数据集。通过粗到细策划策略产生,该数据集保证了高质量视频和详细标题,具有优异的时间一致性。当用于训练视频生成模型时,该数据集导致实验结果优于使用其他模型获得的结果。
引用
@article{arxiv.2408.02629,
title = {VidGen-1M: A Large-Scale Dataset for Text-to-video Generation},
author = {Zhiyu Tan and Xiaomeng Yang and Luozheng Qin and Hao Li},
journal= {arXiv preprint arXiv:2408.02629},
year = {2024}
}
备注
project page: https://sais-fuxi.github.io/projects/vidgen-1m