中文

MMTrail:一个包含语言与音乐描述的多模态影片数据集

计算机视觉与模式识别 2024-12-18 v3 多媒体 声音 音频与语音处理

摘要

大型多模态数据集在推动大型视频语言模型取得成功方面发挥着重要作用。然而,当前的视频语言数据集主要为视觉帧提供文本描述,视为音频是弱相关信息。它们通常忽略了内在音视频相关性的潜力,导致每个模态的标注单调而非全面精确。这种忽视导致了跨模态研究的困难。为填补这一空白,我们提出MMTrail,一个大规模多模态视频语言数据集,包含超过2000万个影片剪辑配以视觉描述,以及200万个具备多模态描述的高质量剪辑。影片预览了完整的电影作品,融合了情境、视觉帧和背景音乐。特别地,影片有两大优势:(1)主题多样化,内容人物类型多样,如电影、新闻和游戏。(2)相应的背景音乐精心设计,与视觉情境高度协调。基于这些见解,我们提出了一套系统化的标注框架,实现了超过2.71万小时影片的多种模态标注。为确保标注在保留视觉情境权威性的同时兼顾音乐视角,我们利用先进的大语言模型对所有标注进行自适应融合。如此一来,我们的MMTrail数据集可能为精细化的大型多模态语言模型训练铺平了道路。在实验中,我们提供评估指标和基准结果,展示了标注的高质量及其对模型训练的有效性。

关键词

引用

@article{arxiv.2407.20962,
  title  = {MMTrail: A Multimodal Trailer Video Dataset with Language and Music Descriptions},
  author = {Xiaowei Chi and Yatian Wang and Aosong Cheng and Pengjun Fang and Zeyue Tian and Yingqing He and Zhaoyang Liu and Xingqun Qi and Jiahao Pan and Rongyu Zhang and Mengfei Li and Ruibin Yuan and Yanbing Jiang and Wei Xue and Wenhan Luo and Qifeng Chen and Shanghang Zhang and Qifeng Liu and Yike Guo},
  journal= {arXiv preprint arXiv:2407.20962},
  year   = {2024}
}

备注

15 Pages. Dataset report