中文

初步探索:为无声视频生成逼真音频

声音 2023-08-25 v1 计算机视觉与模式识别 音频与语音处理

摘要

为电影及其他媒体生成逼真的音频效果是一项具有挑战性的任务,当今主要通过称为 Foley 艺术的物理技术完成。Foley 艺术家在视频播放时利用常见物体(如拳击手套、碎玻璃)同步创作声音,以生成引人入胜的音轨。本文旨在开发一种基于深度学习的框架,完成类似工作——观察自然序列的视频并生成逼真的配套音频。值得注意的是,由于以其他输入为条件的逼真音频生成技术(如以文本为条件的 Wavenet)的进步,我们有理由相信这是可实现的。我们探索了多种不同的模型架构来完成此任务,这些架构同时处理先前生成的音频与视频上下文,包括深度融合 CNN、带视觉上下文的扩张 Wavenet CNN 以及基于 transformer 的架构。我们发现基于 transformer 的架构产生了最有前景的结果,能有效地将低频与视觉模式匹配,但未能生成更细微的波形。

关键词

引用

@article{arxiv.2308.12408,
  title  = {An Initial Exploration: Learning to Generate Realistic Audio for Silent Video},
  author = {Matthew Martel and Jackson Wagner},
  journal= {arXiv preprint arXiv:2308.12408},
  year   = {2023}
}