中文

通过Foley类比从视频进行条件音频生成

计算机视觉与模式识别 2023-04-18 v1 多媒体 声音 音频与语音处理

摘要

设计师为视频添加的音效旨在传达特定的艺术效果,因此可能与场景的真实声音大不相同。受为视频创建不同于其真实声音但仍与屏幕上发生的动作相匹配的配乐这一挑战的启发,我们提出了条件Foley问题。我们提出以下贡献来解决该问题。首先,我们提出一个预训练任务,用于训练我们的模型利用从同一源视频中另一时刻采样的条件音视 clip 来预测输入视频片段的声音。其次,我们提出一个为静音输入视频生成配乐的模型,给定用户提供的指定视频应当“听起来像什么”的示例。我们通过人类研究和自动评估指标表明,我们的模型成功地从视频生成声音,同时根据所提供示例的内容改变其输出。项目主页:https://xypb.github.io/CondFoleyGen/

关键词

引用

@article{arxiv.2304.08490,
  title  = {Conditional Generation of Audio from Video via Foley Analogies},
  author = {Yuexi Du and Ziyang Chen and Justin Salamon and Bryan Russell and Andrew Owens},
  journal= {arXiv preprint arXiv:2304.08490},
  year   = {2023}
}

备注

CVPR 2023