中文

多模态控制下的视频引导 Foley 音频生成

计算机视觉与模式识别 2025-03-18 v4 多媒体 声音 音频与语音处理

摘要

为视频生成音效往往需要创建与真实来源有显著差异的艺术性音效,并且需要灵活的 sound design 控制。为此,我们引入 MultiFoley,这是一个设计用于 video-guided sound generation 的模型,支持通过文本、音频和视频进行多模态条件控制。给定无声视频和文本提示,MultiFoley 允许用户创建干净的 sound(例如,滑板车轮旋转时没有风声)或更加 whimsical 的 sound(例如,使狮子咆哮听起来像小猫的喵叫)。MultiFoley 还允许用户从 sound effects(SFX)库中选择参考音频或部分视频进行条件控制。我们模型的关键新颖性在于其同时在具有低质量 audio 的 internet video 数据集和专业 SFX 记录上进行联合训练,实现 high-quality、full-bandwidth(48kHz) audio generation。通过自动化评估和人类研究,我们展示了 MultiFoley 成功地在各种条件输入下生成同步的 high-quality sound,并优于现有方法。请参阅我们的项目页面获取视频结果:https://ificl.github.io/MultiFoley/

关键词

引用

@article{arxiv.2411.17698,
  title  = {Video-Guided Foley Sound Generation with Multimodal Controls},
  author = {Ziyang Chen and Prem Seetharaman and Bryan Russell and Oriol Nieto and David Bourgin and Andrew Owens and Justin Salamon},
  journal= {arXiv preprint arXiv:2411.17698},
  year   = {2025}
}

备注

Accepted at CVPR 2025. Project site: https://ificl.github.io/MultiFoley/