中文

AutoFoley:基于深度学习的静音视频同步音轨人工合成

声音 2020-06-29 v1 计算机视觉与模式识别 机器学习 音频与语音处理

摘要

在电影制作中,拟音师负责创作叠加音轨,使电影对观众而言鲜活起来。这要求拟音师首先识别能够提升听者体验、从而强化导演对特定场景意图的声音。本文提出 AutoFoley,一种全自动化深度学习工具,可用于为视频合成代表性音轨。AutoFoley 可用于无对应音频文件或需识别关键场景并提供合成增强音轨的应用。合成音轨的重要性能标准是应与输入视频时间同步,从而实现对合成声音真实可信的刻画。与现有声音预测与生成架构不同,我们的算法通过引入插值技术与时间关系网络(TRN),能够精确识别快速运动视频片段中的动作及帧间关系。我们采用与卷积神经网络(CNN)相关联的鲁棒多尺度循环神经网络(RNN),以更好地理解随时间演化的复杂输入输出关联。为评估 AutoFoley,我们创建并引入了一个大规模音视频数据集,包含电影中常用作拟音效果的各种声音。实验表明,合成声音在相关视觉输入准确时间同步下得到真实刻画。AutoFoley 的人类定性测试显示,超过 73% 的受试者认为生成音轨为原始音轨,这是声音合成跨模态研究中的显著进展。

关键词

引用

@article{arxiv.2002.10981,
  title  = {AutoFoley: Artificial Synthesis of Synchronized Sound Tracks for Silent Videos with Deep Learning},
  author = {Sanchita Ghose and John J. Prevost},
  journal= {arXiv preprint arXiv:2002.10981},
  year   = {2020}
}

备注

14 pages, 14 figures