中文

无需对齐视频与文本数据的可扩展且精确的自监督多模态表征学习

计算机视觉与模式识别 2023-04-06 v1 计算与语言

摘要

扩大弱监督数据集已被证明在图像-文本领域极为有效,并促成了绝大多数近期最先进的计算机视觉与多模态神经网络。然而,现有的大规模视频-文本数据集与挖掘技术存在若干局限,如对齐数据稀缺、数据缺乏多样性以及对齐数据收集困难。当前流行的通过自动语音识别(ASR)进行视频-文本数据挖掘的方法(用于 HowTo100M)提供低质量字幕,且常不指代视频内容。其他挖掘方法未提供恰当的语言描述(视频标签)且偏向于短片段(替代文本)。本工作中,我们展示近期图像字幕生成的进展如何使我们无需任何并行视频-文本数据即可预训练高质量视频模型。我们预训练了若干基于 OPT 语言模型与 TimeSformer 视觉骨干网络的视频字幕模型。我们在多个视频字幕数据集上微调这些网络。首先,我们证明图像字幕伪标签用于预训练优于现有 HowTo100M ASR 字幕。其次,我们表明在图像与视频上联合预训练产生的网络(在 MSR-VTT 上 +4 CIDER)显著优于单模态预训练。我们的方法是对现有预训练或数据挖掘方法的补充,可用于多种设置。鉴于伪标签方法的有效性,我们计划公开发布所生成的字幕。

关键词

引用

@article{arxiv.2304.02080,
  title  = {Scalable and Accurate Self-supervised Multimodal Representation Learning without Aligned Video and Text Data},
  author = {Vladislav Lialin and Stephen Rawls and David Chan and Shalini Ghosh and Anna Rumshisky and Wael Hamza},
  journal= {arXiv preprint arXiv:2304.02080},
  year   = {2023}
}