中文

自然场景下的音视频同步

计算机视觉与模式识别 2021-12-09 v1 音频与语音处理

摘要

在本文中,我们考虑了应用于“自然场景”视频(即超出语音的通用类别)的音视频同步问题。作为一项新任务,我们识别并整理了一个具有高音视频相关性的测试集,即VGG-Sound Sync。我们比较了多种基于Transformer的架构变体,这些变体专门设计用于建模任意长度的音频和视觉信号,同时显著降低训练期间的内存需求。我们进一步对整理的数据集进行了深入分析,并为开放域音视频同步定义了一个评估指标。我们将我们的方法应用于标准唇语阅读语音基准数据集LRS2和LRS3,并对各个方面进行了消融研究。最后,我们在新的VGG-Sound Sync视频数据集中为超过160个不同类别的通用音视频同步设立了首个基准。在所有情况下,我们提出的模型都以显著优势超越了先前的最先进水平。

关键词

引用

@article{arxiv.2112.04432,
  title  = {Audio-Visual Synchronisation in the wild},
  author = {Honglie Chen and Weidi Xie and Triantafyllos Afouras and Arsha Nagrani and Andrea Vedaldi and Andrew Zisserman},
  journal= {arXiv preprint arXiv:2112.04432},
  year   = {2021}
}