Koala-36M:提升细粒度条件与视频内容一致性的大规模视频数据集
计算机视觉与模式识别
2025-04-29 v2 人工智能
摘要
随着视觉生成技术的不断进步,视频数据集的规模呈指数级增长。数据集的质量在视频生成模型的性能中起着关键作用。我们断言,时间分割、详细描述和视频质量过滤是数据集质量的三个关键决定因素。然而,现有数据集在这些方面存在诸多局限。为此,我们引入 Koala-36M,一个大规模高质量视频数据集,具有准确的时间分割、详细描述和优异的视频质量。我们方法的核心在于提高细粒度条件与视频内容之间的一致性。具体而言,我们在概率分布上使用线性分类器来增强转换检测的准确性,确保更好的时间一致性。随后,我们为分割后的视频提供结构化描述,平均长度为 200 字,以提高文本-视频对齐。此外,我们开发了视频训练适合性评分(VTSS),将多个子指标整合在一起,允许我们从原始语料库中筛选出高质量视频。最后,我们将多个指标纳入生成模型的训练过程中,进一步细化细粒度条件。我们的实验表明,我们的数据处理管道和提出的 Koala-36M 数据集具有有效性。我们的数据集和代码已发布于 https://koala36m.github.io/。
引用
@article{arxiv.2410.08260,
title = {Koala-36M: A Large-scale Video Dataset Improving Consistency between Fine-grained Conditions and Video Content},
author = {Qiuheng Wang and Yukai Shi and Jiarong Ou and Rui Chen and Ke Lin and Jiahao Wang and Boyuan Jiang and Haotian Yang and Mingwu Zheng and Xin Tao and Fei Yang and Pengfei Wan and Di Zhang},
journal= {arXiv preprint arXiv:2410.08260},
year = {2025}
}
备注
Accepted by CVPR2025. Project page: https://koala36m.github.io/