中文

TIP-I2V:面向图像到视频生成的大规模真实文本与图像提示数据集

计算机视觉与模式识别 2025-07-10 v2

摘要

视频生成模型正在革新内容创作,图像到视频模型因其增强的可控性、视觉一致性和实际应用而日益受到关注。然而,尽管其受欢迎程度很高,这些模型依赖用户提供的文本和图像提示,目前尚无专门用于研究这些提示的数据集。本文中,我们介绍了TIP-I2V——首个面向图像到视频生成的大规模数据集,包含超过170万条独特的用户提供的文本与图像提示。此外,我们提供了来自五个最先进图像到视频模型的对应生成视频。我们首先概述了构建该大规模数据集的耗时且昂贵的过程。接下来,我们将TIP-I2V与两个流行提示数据集VidProM(文本到视频)和DiffusionDB(文本到图像)进行了比较,突出了在基础信息和语义信息方面的差异。该数据集推动了图像到视频研究的进展。例如,为开发更好的模型,研究人员可利用TIP-I2V中的提示分析用户偏好并评估其训练模型的多维性能;为增强模型安全性,他们可专注于解决图像到视频模型引发的错误信息问题。TIP-I2V激发的新研究及其与现有数据集的差异强调了专用图像到视频提示数据集的重要性。该项目可在https://tip-i2v.github.io获取。

关键词

引用

@article{arxiv.2411.04709,
  title  = {TIP-I2V: A Million-Scale Real Text and Image Prompt Dataset for Image-to-Video Generation},
  author = {Wenhao Wang and Yi Yang},
  journal= {arXiv preprint arXiv:2411.04709},
  year   = {2025}
}

备注

Accepted by ICCV 2025