中文

口语化时刻:从视频描述中学习联合音视频表征

计算机视觉与模式识别 2021-05-11 v1 计算与语言 机器学习 声音 音频与语音处理

摘要

当人们观察事件时,能够提取关键信息并构建所发生事件的简明摘要。这些摘要包含描述和观察者认为重要的高层细节(什么、在哪里、谁以及如何)的上下文与语义信息,并排除对观察者而言不重要的背景信息。鉴于此,人们对不同动态事件视频所生成的描述,可极大提升我们对各视频中关注关键信息的理解。这些描述可捕捉于字幕中,为视频标注提供扩展属性(如动作/物体/场景/情感等),同时使我们深入认识人们在总结特定事件时认为重要或必要的内容。现有的视频理解字幕数据集要么规模较小,要么局限于特定领域。为此,我们提出 Spoken Moments (S-MiT) 数据集,包含 50 万条口语字幕,每条对应一段描绘广泛不同事件的独特短视频。我们通过音频录制收集描述,以确保其尽可能自然简洁,同时使我们能扩展大型分类数据集的规模。为利用所提数据集,我们提出一种新颖的自适应均值边界(Adaptive Mean Margin, AMM)对比学习方法,并在多个数据集上评估我们的模型在视频/字幕检索上的表现。我们表明,AMM 方法持续提升了结果,且在 Spoken Moments 数据集上训练的模型比在其他视频-字幕数据集上训练的模型具有更好的泛化能力。

关键词

引用

@article{arxiv.2105.04489,
  title  = {Spoken Moments: Learning Joint Audio-Visual Representations from Video Descriptions},
  author = {Mathew Monfort and SouYoung Jin and Alexander Liu and David Harwath and Rogerio Feris and James Glass and Aude Oliva},
  journal= {arXiv preprint arXiv:2105.04489},
  year   = {2021}
}

备注

To appear at CVPR 2021