中文

AVLnet:从教学视频中学习视听语言表示

计算机视觉与模式识别 2021-07-01 v2 计算与语言 多媒体 声音 音频与语音处理

摘要

当前从视频中学习视觉接地语言的方法通常依赖文本标注,例如人工生成的字幕或机器生成的自动语音识别(ASR)转写文本。在本工作中,我们引入了视听语言网络(AVLnet),一种自监督网络,直接从原始视频输入中学习共享的视听嵌入空间。为规避文本标注需求,我们从随机分割的视频片段及其原始音频波形中学习视听表示。我们在 HowTo100M(一个大规模公开教学视频语料库)上训练 AVLnet,并在图像检索和视频检索任务上评估,取得了最先进的性能。我们对 AVLnet 学到的表示进行分析,表明我们的模型利用语音和自然声音来学习视听概念。进一步,我们提出了一种三模态模型,联合处理原始音频、视频和视频的文本字幕,以学习可用于文本-视频检索的多模态语义嵌入空间。我们的代码、数据和训练模型将在 avlnet.csail.mit.edu 发布。

关键词

引用

@article{arxiv.2006.09199,
  title  = {AVLnet: Learning Audio-Visual Language Representations from Instructional Videos},
  author = {Andrew Rouditchenko and Angie Boggust and David Harwath and Brian Chen and Dhiraj Joshi and Samuel Thomas and Kartik Audhkhasi and Hilde Kuehne and Rameswar Panda and Rogerio Feris and Brian Kingsbury and Michael Picheny and Antonio Torralba and James Glass},
  journal= {arXiv preprint arXiv:2006.09199},
  year   = {2021}
}

备注

A version of this work has been accepted to Interspeech 2021