CI-VID:一个连贯交错文本-视频数据集
计算机视觉与模式识别
2025-07-03 v1
摘要
文本到视频(T2V)生成近年来受到广泛关注,推动了大量高质量数据集的发展。然而,现有公开数据集主要由独立的文本-视频(T-V)配对组成,无法支持连贯的多段视频序列建模。为此,我们提出了 CI-VID 数据集,超越独立的文本到视频(T2V)生成,引入文本-视频到视频(TV2V)生成,使模型能够生成连贯的、多场景的视频序列。CI-VID 包含超过 34 万个样本,每个样本包含一系列连贯的视频片段,配有文本说明,既捕获每个片段的独立内容,也捕获片段之间的过渡,实现视觉和文本的联合生成。为进一步验证 CI-VID 的有效性,我们设计了包含人类评估、基于视觉语言模型的评估和基于相似性的指标的全面、多维度基准。实验结果表明,在 CI-VID 上训练的模型在生成视频序列方面在准确性和内容一致性方面均显著提升。这有助于创建具有平滑视觉过渡和强时间一致性的叙事性内容,凸显了 CI-VID 数据集的质量和实际实用性。我们将公开发布 CI-VID 数据集及构建和评估代码:https://github.com/ymju-BAAI/CI-VID
引用
@article{arxiv.2507.01938,
title = {CI-VID: A Coherent Interleaved Text-Video Dataset},
author = {Yiming Ju and Jijin Hu and Zhengxiong Luo and Haoge Deng and hanyu Zhao and Li Du and Chengwei Wu and Donglin Hao and Xinlong Wang and Tengfei Pan},
journal= {arXiv preprint arXiv:2507.01938},
year = {2025}
}