InternVid:用于多模态理解与生成的大规模视频-文本数据集
计算机视觉与模式识别
2024-01-05 v2
摘要
本文介绍InternVid,一个大规模以视频为中心的多模态数据集,能够学习强大且可迁移的视频-文本表示,用于多模态理解与生成。InternVid数据集包含超过700万段视频,总时长近760K小时,产生2.34亿个视频片段,并附有总计41亿词的详细描述。我们的核心贡献是开发一种可扩展方法,利用大语言模型(LLM)自主构建高质量视频-文本数据集,从而展示其在大规模学习视频-语言表示方面的功效。具体而言,我们采用多尺度方法生成视频相关描述。此外,我们引入ViCLIP,一种基于ViT-L的视频-文本表示学习模型。该模型通过对比学习在InternVid上训练,展示了领先的零样本动作识别性能和有竞争力的视频检索性能。除识别和检索等基础视频理解任务外,我们的数据集和模型具有广泛应用。它们特别有益于生成交错视频-文本数据以学习以视频为中心的对话系统,推进视频到文本和文本到视频生成研究。这些提出的资源为关注多模态视频理解与生成的研究人员和从业者提供了工具。
引用
@article{arxiv.2307.06942,
title = {InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation},
author = {Yi Wang and Yinan He and Yizhuo Li and Kunchang Li and Jiashuo Yu and Xin Ma and Xinhao Li and Guo Chen and Xinyuan Chen and Yaohui Wang and Conghui He and Ping Luo and Ziwei Liu and Yali Wang and Limin Wang and Yu Qiao},
journal= {arXiv preprint arXiv:2307.06942},
year = {2024}
}
备注
Data and Code: https://github.com/OpenGVLab/InternVideo/tree/main/Data/InternVid