中文

VAST:一种视觉-音频-字幕-文本全模态基础模型与数据集

计算机视觉与模式识别 2023-10-10 v2 人工智能 计算与语言 机器学习 音频与语音处理

摘要

当代视频-文本基础模型已充分探索视觉与文本,而视频中的音频、字幕等其他模态尚未受到足够关注。本文旨在通过构建名为VAST-27M的自动生成大规模全模态视频描述数据集,建立包括视觉、音频、字幕在内的多模态视频轨道与文本之间的联系。具体而言,我们首先收集2700万开放域视频片段,分别训练视觉与音频描述器生成视觉与音频描述;随后采用现成的大语言模型(LLM)将生成的描述与字幕及指令提示整合为全模态描述。基于提出的VAST-27M数据集,我们训练了名为VAST的全模态视频-文本基础模型,其能感知并处理视频中的视觉、音频与字幕模态,并更好地支持包括视觉-文本、音频-文本及多模态视频-文本任务(检索、描述与问答)在内的各类任务。大量实验证明了我们所提VAST-27M语料库与VAST基础模型的有效性。VAST在各种跨模态基准上取得22项新的SOTA结果。代码、模型与数据集将于 https://github.com/TXH-mercury/VAST 发布。

关键词

引用

@article{arxiv.2305.18500,
  title  = {VAST: A Vision-Audio-Subtitle-Text Omni-Modality Foundation Model and Dataset},
  author = {Sihan Chen and Handong Li and Qunbo Wang and Zijia Zhao and Mingzhen Sun and Xinxin Zhu and Jing Liu},
  journal= {arXiv preprint arXiv:2305.18500},
  year   = {2023}
}

备注

Accepted by NeurIPS 2023