中文

SyncFusion:基于多模态起始时刻同步的视频到音频拟音合成

声音 2023-10-25 v1 计算机视觉与模式识别 机器学习 多媒体 音频与语音处理

摘要

声音设计涉及为电影、视频游戏以及虚拟/增强现实等多种媒体创造性地挑选、录制和编辑音效。在设计声音时,最耗时的步骤之一是将音频与视频同步。在某些情况下,视频拍摄时的环境录音可用,这有助于该过程。然而,在视频游戏和动画中,不存在参考音频,需要从视频中手动标注事件时序。我们提出了一种从视频中提取重复动作起始时刻的系统,这些起始时刻随后与音频或文本嵌入结合,用于条件化一个经过训练以生成新的同步音效音轨的扩散模型。通过这种方式,我们在去除与视频同步负担的同时,将完整的创作控制权留给声音设计师。此外,编辑起始时刻轨或更改条件嵌入比编辑音轨本身所需的工作量小得多,从而简化了拟音过程。我们提供声音示例、源代码和预训练模型以促进可复现性。

关键词

引用

@article{arxiv.2310.15247,
  title  = {SyncFusion: Multimodal Onset-synchronized Video-to-Audio Foley Synthesis},
  author = {Marco Comunità and Riccardo F. Gramaccioni and Emilian Postolache and Emanuele Rodolà and Danilo Comminiello and Joshua D. Reiss},
  journal= {arXiv preprint arXiv:2310.15247},
  year   = {2023}
}