ViMix-14M:面向长篇高质量标题的多源视频文本数据集与无爬取访问
计算机视觉与模式识别
2025-11-25 v1
摘要
自 Sora 之后,文本到视频生成受到了广泛关注,但开源模型仍面临数据瓶颈:缺乏大型高质量且易获取的视频文本语料库.现有公开数据集通常需要手动爬取 YouTube,由于链接失效和访问限制,实际可用量较低,并存在许可风险.本工作通过引入 ViMix-14M,一个约含 1400 万对的精选多源视频文本数据集,以提供无爬取、即下载即用且标题长篇且高质量、紧密对齐视频的解决方案. ViMix-14M 通过整合多样化开放视频来源,随后进行统一去重与质量筛选,并构建一种多粒度、以真实为导向的重述管线,以更好地匹配动作、场景和时间结构,细化描述.我们通过多模态检索、文本到视频生成和视频问答任务对数据集进行评估,结果显示相较于对手数据集,ViMix-14M 在所有任务上均实现了持续性改进.我们希望本工作能够帮助消除训练和微调开源视频基础模型的关键障碍,并为构建高质量且可泛化的视频文本数据集提供洞见.
引用
@article{arxiv.2511.18382,
title = {ViMix-14M: A Curated Multi-Source Video-Text Dataset with Long-Form, High-Quality Captions and Crawl-Free Access},
author = {Timing Yang and Sucheng Ren and Alan Yuille and Feng Wang},
journal= {arXiv preprint arXiv:2511.18382},
year = {2025}
}