Youku-mPLUG:用于预训练与基准测试的大规模千万级中文视频-语言数据集
计算机视觉与模式识别
2023-06-08 v1 计算与语言
摘要
为推动中文社区视觉-语言预训练(VLP)和多模态大语言模型(LLM)的发展,我们首次发布了最大的公开中文高质量视频-语言数据集 Youku-mPLUG,该数据集采集自知名中文视频分享网站优酷,并遵循安全、多样性和质量的严格标准。Youku-mPLUG 包含从 4 亿原始视频中筛选出的 1000 万中文视频-文本对,涵盖 45 个广泛多样的类别,用于大规模预训练。此外,为便于对视频-语言模型进行全面评估,我们精心构建了最大规模的人工标注中文基准,覆盖跨模态检索、视频字幕生成和视频类别分类三种流行的视频-语言任务。Youku-mPLUG 能使研究者在未来开展更深入的多模态研究并开发更好的应用。进一步地,我们发布了流行的视频-语言预训练模型 ALPRO 和 mPLUG-2,以及我们提出的在 Youku-mPLUG 上预训练的模块化仅解码器模型 mPLUG-video。实验表明,在 Youku-mPLUG 上预训练的模型在视频类别分类上最高提升 23.1%。此外,mPLUG-video 在这些基准上取得了新的 SOTA 结果,视频类别分类 top-1 准确率达 80.5%,视频字幕生成 CIDEr 分数达 68.9。最后,我们以仅 1.7% 可训练参数在冻结的 Bloomz 基础上扩展 mPLUG-video 作为中文多模态 LLM,并展示了令人惊叹的指令和视频理解能力。零样本指令理解实验表明,使用 Youku-mPLUG 预训练可增强对整体与细节视觉语义的理解、场景文本识别以及开放域知识的运用能力。
引用
@article{arxiv.2306.04362,
title = {Youku-mPLUG: A 10 Million Large-scale Chinese Video-Language Dataset for Pre-training and Benchmarks},
author = {Haiyang Xu and Qinghao Ye and Xuan Wu and Ming Yan and Yuan Miao and Jiabo Ye and Guohai Xu and Anwen Hu and Yaya Shi and Guangwei Xu and Chenliang Li and Qi Qian and Maofei Que and Ji Zhang and Xiao Zeng and Fei Huang},
journal= {arXiv preprint arXiv:2306.04362},
year = {2023}
}
备注
Working in progress